--- title: "00-爬虫课程六讲" created: 2026-09-06 tags: - 项目 aliases: - 爬虫课程六讲 --- # 爬虫课程六讲 > [!info] 本组定位 > 自研 chu 招聘爬虫系统的**前置课程线**——六讲从"爬虫是什么"讲到"对照项目源码拆解",前三讲打概念(采集通道/基础积木),第 4 讲动手拼最小职位爬虫并进入动态网页,第 5 讲讲工程化跃迁,第 6 讲(1253 行)逐行拆解 chu 系统源码(SpiderCom/DOM 抓取/API 直连/on_response 主干线)。与 [[00-项目导航|06-招聘数据自动化]] 的模块代码全文互为表里:这边讲"为什么",那边放"是什么"。 ## 组内结构 | 篇 | 内容 | 原讲次 | | --- | --- | --- | | [[01-爬虫是什么\|01-爬虫是什么]] | 一句话定义 + 合法性边界 + 与搜索引擎的区别 | 第 1 讲 | | [[02-四重采集通道\|02-四重采集通道]] | 静态 HTML / API / on_response / 浏览器自动化四条采集通道 | 第 2 讲 | | [[03-爬虫的基础积木——每个动作能得到什么效果\|03-爬虫的基础积木]] | 每个动作(请求/解析/存储)能得到什么效果 | 第 3 讲 | | [[04-用积木拼一个最小职位爬虫\|04-用积木拼一个最小职位爬虫]] | 60 行最小可运行职位爬虫 | 第 4 讲 | | [[05-当 requests 不够用时——进入动态网页与浏览器自动化\|05-当 requests 不够用时]] | 动态网页与浏览器自动化(2202 行长文) | 第 4 讲扩展 | | [[06-练手\|06-练手]] | quotes.toscrape / fake-jobs 练手实录 | 第 4 讲练手 | | [[07-练手网站\|07-练手网站]] | 练手站点清单与要点 | 第 4 讲练手 | | [[08-从能跑到能稳定跑很久——爬虫的工程化跃迁\|08-从能跑到能稳定跑很久]] | 工程化跃迁:重试/并发/持久化/监控 | 第 5 讲 | | [[09-对照项目源码拆解——从配置到入库的完整链路\|09-对照项目源码拆解]] | 追踪一条职位数据的完整生命线,逐行对照 chu 源码 | 第 6 讲 | ## 学习动线 零基础入门走 01→04;读完想看"真系统长什么样"直接跳 [[09-对照项目源码拆解——从配置到入库的完整链路|09-对照项目源码拆解]],配合 [[00-项目导航|06-项目导航]] 的六模块依赖动线读源码。 --- **项目分区导航**:⬅️ [[00-Python与爬虫总览|00-Python与爬虫总览]] | 00-爬虫课程六讲 | ➡️ [[01-爬虫是什么|01-爬虫是什么]]