Daily

2026-04-01

5篇笔记
2-Learning 1740 字
爬虫架构总览

爬虫 一、整体设计思路 这套爬虫是一个多站点、生产级的招聘数据采集系统,不是简单的脚本,而是有完整的工程化设计。核心分三层: 基类(spider.py)→ 各平台子类(spider\_liepin/yupao/51job)→ 远端服务集群

2-Learning 407 字
学习顺序

学习顺序 先读 spider.py —— 理解整个基础设施,特别是文件管理和入库逻辑 再读 spider_liepin.py 的 toInstance 和 onResponese —— 理解 Playwright + 接口拦截的核心模式 看

2-Learning 5820 字
Spider.py基类深度解析

Spider.py 基类深度解析 一、整体定位 这是一个爬虫基础设施基类,所有具体爬虫(如猎聘、BOSS直聘等)都继承它。它不负责具体抓取逻辑,而是提供: text Spider 基类 ├── 配置管理(读 ini 文件) ├── 文件/文

2-Learning 9471 字
getProxy-setProxyRecord

getProxy/setProxyRecord 一、整体架构 !imagee11f53cb.png 二、getProxy —— 获取代理 python coding: utf8 """ @Desc : 获取可用代理 @Date : 2024

2-Learning 12257 字
spider.py

spider.py python coding: utf8 """ @Desc : 基类 @Date : 2024/7/3 19:31 @Author : gaofenfei """ import time,os,requests,rand