首页 > Web开发 > 详细

获取任意网页的编码格式

时间:2017-08-07 14:23:11      阅读:268      评论:0      收藏:0      [点我收藏+]
如果是非定向爬虫,不是专门爬一个固定位置的信息,而是成千上万的未知网站,那就需要找到编码格式了,使用如下正则,可以正确找到,准确率99%
content=requests.get(url).content
bianma_group=re.search(‘<meta[\s\S]*?charset="?([a-zA-Z0-9\-]*)‘, respbody0, re.IGNORECASE)
if bianma_group:
print bianma_group.group(1)

获取任意网页的编码格式

原文:http://www.cnblogs.com/ydf0509/p/7298863.html

(0)
(0)
   
举报
评论 一句话评论(0
关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com
© 2014 bubuko.com 版权所有
打开技术之扣,分享程序人生!