爬虫课程六讲

ℹ️本组定位

自研 chu 招聘爬虫系统的前置课程线——六讲从"爬虫是什么"讲到"对照项目源码拆解",前三讲打概念(采集通道/基础积木),第 4 讲动手拼最小职位爬虫并进入动态网页,第 5 讲讲工程化跃迁,第 6 讲(1253 行)逐行拆解 chu 系统源码(SpiderCom/DOM 抓取/API 直连/on_response 主干线)。与 06-招聘数据自动化 的模块代码全文互为表里:这边讲"为什么",那边放"是什么"。

组内结构

内容 原讲次
01-爬虫是什么 一句话定义 + 合法性边界 + 与搜索引擎的区别 第 1 讲
02-四重采集通道 静态 HTML / API / on_response / 浏览器自动化四条采集通道 第 2 讲
03-爬虫的基础积木 每个动作(请求/解析/存储)能得到什么效果 第 3 讲
04-用积木拼一个最小职位爬虫 60 行最小可运行职位爬虫 第 4 讲
05-当 requests 不够用时 动态网页与浏览器自动化(2202 行长文) 第 4 讲扩展
06-练手 quotes.toscrape / fake-jobs 练手实录 第 4 讲练手
07-练手网站 练手站点清单与要点 第 4 讲练手
08-从能跑到能稳定跑很久 工程化跃迁:重试/并发/持久化/监控 第 5 讲
09-对照项目源码拆解 追踪一条职位数据的完整生命线,逐行对照 chu 源码 第 6 讲

学习动线

零基础入门走 01→04;读完想看"真系统长什么样"直接跳 09-对照项目源码拆解,配合 06-项目导航 的六模块依赖动线读源码。


项目分区导航:⬅️ 00-Python与爬虫总览 | 00-爬虫课程六讲 | ➡️ 01-爬虫是什么