首页 > 其他 > 详细

爬虫中文乱码繁体字乱码问题解决

时间:2019-05-31 11:15:55      阅读:340      评论:0      收藏:0      [点我收藏+]

工作需要爬取淘宝对应的卖家账户,为了简单就直接用正则匹配所需掌柜名称。  ps:项目较老,用的python2.7

遇到三个问题:

1.中文乱码,开始直接就 Response.encoding = ‘utf-8‘,结果中文都是乱码。查资料可以用  Response.apparent_encoding 看出返回网页的编码格式 GB2312

2.繁体字乱码 简单中文没问题,但是繁体字又是乱码,而且Response.apparent_encoding=‘GB2312’,再查资料,直接在浏览器看网页源码,找到 <meta charset="gbk">,改成gbk问题解决

3.汉字无法正则匹配,因Response.text是unicode格式,需转成python支持的utf-8

 

技术分享图片

 

爬虫中文乱码繁体字乱码问题解决

原文:https://www.cnblogs.com/yeteng/p/10954100.html

(0)
(0)
   
举报
评论 一句话评论(0
关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com
© 2014 bubuko.com 版权所有
打开技术之扣,分享程序人生!