Daily

2026-04-03

8篇笔记
后端与微服务 50273 字
爬虫系统建设实战

爬虫系统建设实战 爬虫系统建设实战文档 —— 从零搭建一套可维护、可扩展、可自愈的招聘信息爬虫 一、先建立正确认知:爬虫不是"抓网页",而是"建立数据生产线" 很多人学爬虫,停留在: requests 请求网页 BeautifulSoup

2-Learning 44086 字
爬虫系统建设

爬虫系统建设 —— 从零搭建一套可维护、可扩展、可自愈的爬虫 一、先建立正确认知:爬虫不是"抓网页",而是"建立数据生产线" 很多人学爬虫,停留在: requests 请求网页 BeautifulSoup / XPath 抽内容 存 CSV

2-Learning 50367 字
爬虫系统建设实战

爬虫系统建设实战 20260403 爬虫系统建设实战文档 —— 从零搭建一套可维护、可扩展、可自愈的招聘信息爬虫 一、先建立正确认知:爬虫不是"抓网页",而是"建立数据生产线" 很多人学爬虫,停留在: requests 请求网页 Beaut

2-Learning 9233 字
zhaogebanshang

zhaogebanshang 聚合来自企业官网、招聘站点、招聘公众号等多渠道的招聘信息,统一标准化展示,帮助应届生更方便地发现校招、实习、全职机会,并跳转到原始投递页面完成投递。 用户痛点 很多企业只在官网招聘页发布岗位,不会同步到主流招聘

2-Learning 8282 字
main.py

main.py main.py — 入口与调度中心 通过 m 参数控制运行模式,主要流程如下: 参数值 功能 p 爬取学校网站数据 ann 解析爬取结果,调用大模型处理公告 ann_wx 处理微信公众号来源的公告 ann_api 上传处理结

2-Learning 15233 字
spider_com.py

spider_com.py spider_com.py — 大公司官网爬虫 核心类 SpiderCom,结构与 SpiderSch 高度相似,但针对企业招聘页有额外扩展: 支持无限滚动页面:通过 scrollHeight 判断是否到底,自动

2-Learning 13700 字
spider_data.py

spider_data.py spider_data.py — 数据处理与上传 核心类 SpiderData,消费爬虫产出的 JSON+HTML 文件,驱动后续处理流水线。 process_announcement_data 是核心方法,根

2-Learning 15545 字
spider_sch.py

spider_sch.py spider_sch.py — 学校官网爬虫 核心类 SpiderSch,负责从高校招聘页爬取数据。 流程: 1. 读取 INI 配置文件(setting_sch_.ini),加载每所学校的URL、CSS选择器、