首页 > 其他 > 详细

爬虫复习

时间:2020-06-07 00:14:55      阅读:47      评论:0      收藏:0      [点我收藏+]

HTML和XML区别

XML标签自定义,HTML 标签内置的

正则复习

python 栈使用list实现

append pop  后进先出

队列 collections.deque

append()  popleft()

原子组成正则表达式的最小单位,任何字符都可以

技术分享图片

 

 

 技术分享图片

 

 技术分享图片

 爬虫

用途,数据分析,人工智能数据集,作为社交软件冷启动,舆情监控,竞争对手监控

 

数据抓取(requests /urllib / pycurl / 工具 ----------->  cul / wget/ httpie ),数据解析,数据存储

 301永久重定向,302暂时重定向   https://blog.csdn.net/ai2000ai/article/details/80242193

请求头 :  Accept cookie User-Agent

Referer  来源网址

curl -A "Chrome"  http://www.baidu.com

httpbin.org  

curl -X POST http://httpbin.org/post

head 方法  

curl -I http://httpbin.org   返回响应报文的相应行和响应头

 

爬虫复习

原文:https://www.cnblogs.com/z-y-l/p/13057582.html

(0)
(0)
   
举报
评论 一句话评论(0
关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com
© 2014 bubuko.com 版权所有
打开技术之扣,分享程序人生!