爬虫课程六讲
本组定位
自研 chu 招聘爬虫系统的前置课程线——六讲从"爬虫是什么"讲到"对照项目源码拆解",前三讲打概念(采集通道/基础积木),第 4 讲动手拼最小职位爬虫并进入动态网页,第 5 讲讲工程化跃迁,第 6 讲(1253 行)逐行拆解 chu 系统源码(SpiderCom/DOM 抓取/API 直连/on_response 主干线)。与 06-招聘数据自动化 的模块代码全文互为表里:这边讲"为什么",那边放"是什么"。
组内结构
| 篇 | 内容 | 原讲次 |
|---|---|---|
| 01-爬虫是什么 | 一句话定义 + 合法性边界 + 与搜索引擎的区别 | 第 1 讲 |
| 02-四重采集通道 | 静态 HTML / API / on_response / 浏览器自动化四条采集通道 | 第 2 讲 |
| 03-爬虫的基础积木 | 每个动作(请求/解析/存储)能得到什么效果 | 第 3 讲 |
| 04-用积木拼一个最小职位爬虫 | 60 行最小可运行职位爬虫 | 第 4 讲 |
| 05-当 requests 不够用时 | 动态网页与浏览器自动化(2202 行长文) | 第 4 讲扩展 |
| 06-练手 | quotes.toscrape / fake-jobs 练手实录 | 第 4 讲练手 |
| 07-练手网站 | 练手站点清单与要点 | 第 4 讲练手 |
| 08-从能跑到能稳定跑很久 | 工程化跃迁:重试/并发/持久化/监控 | 第 5 讲 |
| 09-对照项目源码拆解 | 追踪一条职位数据的完整生命线,逐行对照 chu 源码 | 第 6 讲 |
学习动线
零基础入门走 01→04;读完想看"真系统长什么样"直接跳 09-对照项目源码拆解,配合 06-项目导航 的六模块依赖动线读源码。
项目分区导航:⬅️ 00-Python与爬虫总览 | 00-爬虫课程六讲 | ➡️ 01-爬虫是什么
💬 评论