WinForm使用webbrowser爬取数据，中文乱码问题

时间：2014-12-17 00:07:10 阅读：611 评论：0 收藏：0 [点我收藏+]

使用winform中的webbrowser抓取某个网站的数据时，遇到中文乱码的问题：

当时使用的获取网页内容的代码为：

webBrowser1.DocumentText.ToString();

不管我如何使用转换编码的方式进行转换，都是乱码，在度娘的帮助下，终于找到正确答案：

如果所爬取的网站的编码是GB2312，则可以使用如下代码进行读取网页数据：

System.IO.StreamReader Reader = new System.IO.StreamReader(this.webBrowser1.DocumentStream, System.Text.Encoding.GetEncoding("GB2312")); 
  string Document = null; 
  Document = Reader.ReadToEnd();

如果所爬取的网站的编码UTF8，则使用下面的代码处理：

System.IO.StreamReader Reader = new System.IO.StreamReader(this.webBrowser1.DocumentStream, System.Text.Encoding.GetEncoding("utf-8"));

不论网站的编码格式为何，都可以使用如下方式处理：

System.IO.StreamReader Reader = new System.IO.StreamReader(this.webBrowser1.DocumentStream, System.Text.Encoding.GetEncoding(this.webBrowser1.Document.Encoding ));

WinForm使用webbrowser爬取数据，中文乱码问题

原文：http://www.cnblogs.com/chenfengmugu/p/4168390.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年09月23日 (328)
2021年09月24日 (313)
2021年09月17日 (191)
2021年09月15日 (369)
2021年09月16日 (411)
2021年09月13日 (439)
2021年09月11日 (398)
2021年09月12日 (393)
2021年09月10日 (160)
2021年09月08日 (222)