爬虫是什么
爬虫是什么 先用一句话说清楚: 爬虫就是一个自动帮你打开网页、读取数据、提取有用信息、保存起来的程序。 它做的事情,本质上和人打开浏览器看网页差不多,只不过人是用眼睛看、手动复制;爬虫是用代码访问网页、自动提取。 1. 先用一个生活化比喻理
四重采集通道四重采集通道 上一讲我们已经知道: 爬虫的核心问题不是“怎么写代码”,而是先判断: 数据到底在哪里? 这一讲就围绕这个问题展开。 同样是抓职位信息,数据可能出现在四个地方: text HTML 页面里 JavaScript 渲染后的页面里
爬虫的基础积木——每个动作能得到什么效果爬虫的基础积木——每个动作能得到什么效果 前两讲我们解决了"爬虫是什么"和"有哪些采集通道"的问题。 这一讲开始进入实战的第一步:把爬虫拆成一个个最小的"动作积木"。 只要理解每块积木"输入什么、输出什么、解决什么问题",后面再看真实项目里