Daily

2026-04-02

40篇笔记
2-Learning 446 字
项目导航

chu taskschd.msc 192.168.88.67 admin wangye!@123 1. 00parsegptparsegpt → 解析网页结构,用GPT生成爬虫模板 2. 00auto_genauto_gen/00auto_

2-Learning 3187 字
链路追踪

链路追踪 定时任务 !imagee83adfd1.png bat @echo off echo 正在启动中... call E:\chu\python310_ve\Scripts\activate.bat cd /d E:\chu\qzcl

2-Learning 7187 字
全链路流程梳理

全链路流程梳理:招聘数据自动化抓取 一、系统全景架构 !image62607bc7.png 二、启动阶段(定时任务 → 配置加载) 2.1 定时任务脚本 bat @echo off echo 正在启动中... call E:\chu\pyt

2-Learning 2794 字
parsegpt

parsegpt 这是一套校招/社招公告的全链路解析系统,把爬取到的原始 HTML 页面转化为结构化 JSON,供后续搜索、展示、推荐使用。整体由五个模块分工协作,有一条明确的主干流程,也有两条独立的分支路径。 !image42313e76

2-Learning 9503 字
ann_img

ann_img.py ann_img.py — 图片处理与 OCR 组件 下载公告图片 → MD5/感知哈希去重 → 二维码识别(纯二维码/混合图/普通图)→ PaddleOCR 文字识别 → 多层黑名单过滤 → 上传华为云 OBS 替换

2-Learning 10239 字
ann_md

ann_md.py ann_md.py — HTML 预处理与 Markdown 转换 解析流水线的第一道关卡:清洗噪音 DOM → 修复链接/图片路径 → 硬编码字段提取 → 表格转 Markdown → 渠道专项修复。六件事详解见 00

2-Learning 13573 字
ann_model

ann_model.py ann_model.py — 核心调度器(主入口) 整个解析系统的大脑,串联所有模块:公告级解析 → 职位列表解析 → Markdown 格式处理三阶段,输出标准 JSON 模型文件。三阶段详解见 00parseg

2-Learning 4233 字
ann_model_job

ann_model_job.py ann_model_job.py — 公告内单职位解析 由 03ann_modelann_model 分支调用:HTML 转纯文本 → Qwen 大模型提取 → 校验质量 → 与公告元数据(公司名、链接、申

2-Learning 7746 字
cjob_model

cjob_model.py cjob_model.py — 大公司职位详情页解析 独立入口(不经过 03ann_modelann_model):detail_selector 精准定位职位正文 → Header 区域提取职位类别/地点/人数

2-Learning 4258 字
html_to_text

html_to_text.py html_to_text.py — 底层 HTML 清洗 最底层工具,被多个上层模块调用:HTML 转纯文本,对 <table 按行合并保留表格语义,清理 CSS/JS/隐藏元素/&nbsp; 等噪音。 代码

2-Learning 1275 字
auto_gen

auto_gen 这是一个自动化的 HTML 列表解析系统,核心思路是"为每个网站生成专属的解析函数",用来从各大学就业网的公告列表页中批量提取招聘信息。 问题背景 每所学校的就业网页面结构都不一样,比如: gen_00001.py:找 u

2-Learning 2797 字
func_call

func_call.py func_call.py — 运行时调度器 importlib 动态加载指定的 gen_ 模块执行解析;结果为空自动触发 02func_gen_bygptfunc_gen_bygpt 让大模型重新生成。完整流程见

2-Learning 1500 字
func_gen_bygpt

func_gen_bygpt.py func_gen_bygpt.py — 兜底生成器 解析结果为空时,把该学校的 HTML 样本发给大模型,自动生成新的 gen_func_code_{key}_tmp.py(幂等保护:文件已存在则跳过,不

2-Learning 1210 字
gen_000xx

gen_000xx.py gen_000xx.py — 学校专属解析函数(示例) 每所学校一个文件,实现统一接口 extract_table_from_htmlhtmlcontext, tempfile,输出统一 JSON(announce

2-Learning 1201 字
auto_gen_com

auto_gen_com 这是大公司招聘网站的爬虫自动化模块,和之前学校就业网的模块是同一套架构,但针对企业招聘页面做了扩展。对比来看: 与上一个模块的区别 学校就业网模块 大公司招聘模块(本模块) 目标 学校就业网公告列表 企业招聘网站职

2-Learning 795 字
click_50001

click_50001.py click_50001.py — 页面交互函数 自动查找并点击"博士生招聘"标签/按钮:优先匹配 label,兜底匹配 span,防止页面结构变化导致点击失败。 代码 python def crawl_page

2-Learning 2131 字
func_call

func_call.py func_call.py — 运行时调度器(大公司版) 与 01func_callauto_gen 的 func_call 同源,面向大公司招聘页面的解析调度:动态加载解析函数 → 执行 → 结果为空触发大模型重新

2-Learning 1300 字
func_gen_bygpt

func_gen_bygpt.py func_gen_bygpt.py — 兜底生成器(大公司版) 与 02func_gen_bygptauto_gen 的 func_gen_bygpt 同源:解析为空时把 HTML 样本发给大模型,自动生

2-Learning 1936 字
gen_00001

gen_00001.py gen_00001.py — 大公司专属解析函数(示例) 实现统一接口 extract_table_from_htmlhtmlcontext, tempfile 的大公司版解析函数。分工背景见 00auto_gen

2-Learning 641 字
page_00001

page_00001.py page_00001.py — 页面交互函数(示例) 实现 crawl_page 页面处理函数(模拟点击/翻页等交互动作)的大公司版示例。 代码 python 进行翻页操作:点击下一页按钮 def crawl_p

2-Learning 1554 字
auto_on_response

auto_on_response 这是针对兴业银行招聘网站的专项爬虫模块,采用了一种特殊的网络请求拦截方式来获取数据,而不是解析 HTML。 为什么要拦截网络请求 兴业银行的招聘页面是前后端分离的 SPA(单页应用),职位数据通过 Ajax

2-Learning 921 字
main_proc

main_proc.py main_proc.py — 入口路由 根据 _key(公司编号)分发到专项处理函数:目前只有 com_91000(兴业银行)一个分支,后续新增特殊公司在这里加 elif 即可。设计背景见 00auto_on_re

2-Learning 3834 字
xingye_proc

xingye_proc.py xingye_proc.py — 兴业银行专项爬虫 注册 Playwright 响应拦截器 → 自动翻页 → 捕获招聘 API 的 JSON 响应 → 字段映射 + generate_html 拼伪 HTML

2-Learning 2169 字
auto_api

auto_api 这是大公司招聘API直连爬取模块,与之前兴业银行的"Playwright拦截响应"方式不同,这里大部分公司是直接调用其招聘后台API接口获取数据。 整体结构 baidu_data_proc_api.py 里的 api_pr

2-Learning 7157 字
baidu_data_proc_api

baidu_data_proc_api.py baidu_data_proc_api.py — 百度招聘直连 api_proc 总入口所在文件。直接 POST 百度招聘后台 API 拿分页 JSON,带代理池(getProxy 递归重试取可

2-Learning 6945 字
isoftstone_data_proc_api

isoftstone_data_proc_api.py isoftstone_data_proc_api.py — 软通动力直连 两套 API 响应格式自动适配(社招 code/data/list / 校招 results/count);详

2-Learning 10332 字
jd_data_proc_api

jd_data_proc_api.py jd_data_proc_api.py — 京东招聘直连 POST 接口拿职位 JSON,generate_job_html 把结构化数据拼成完整 HTML 落盘,无缝进入后续 ann_md → an

2-Learning 7655 字
kingdee_data_proc_api

kingdee_data_proc_api.py kingdee_data_proc_api.py — 金蝶 JS 文件解析 职位数据直接发布在静态 jobs.js 里(较少见的方案):正则从 JS 文本提取 jobs = ... 数组解析

2-Learning 18086 字
picc_data_proc_api

picc_data_proc_api.py picc_data_proc_api.py — 中国人保直连(最全) 社招/校招/实习三条通道各自独立的取数 → 字段转换(transform)→ HTML 生成函数,体量是本模块最大的一个(超过

2-Learning 2056 字
api

api 这是一个非常典型的AI驱动的招聘数据抓取、解析与结构化处理系统。工作流涵盖了从非结构化数据(图片、长文本)输入,到通过多种大语言模型(LLMs)进行信息抽取与标准化,最后将数据同步至云端数据库的完整闭环。 一、 核心大模型(LLM)

2-Learning 908 字
deepseek_api

deepseek_api.py deepseek_api.py — DeepSeek 接口封装 OpenAI 兼容调用方式(call_gpt),目前作为备用模型或实验性接口存在。模块分工见 00apiapi 主篇。 代码 python Pl

2-Learning 4871 字
doubao_api

doubao_api.py doubao_api.py — 豆包大模型接口(核心) call_gpt / call_gpt_system 双接口;fix_return_json 清理大模型返回内容中的 Markdown json 代码围栏包

2-Learning 12563 字
doubao_api_new

doubao_api_new.py doubao_api_new.py — 豆包接口(Prompt Caching 版) 火山引擎 DeepSeek 带上下文缓存:首次运行创建缓存并保存 response_id,本地 json 持久化 +

2-Learning 3434 字
hwcloud_api

hwcloud_api.py hwcloud_api.py — 华为云 OBS 上传 本地文件 / 二进制流两类上传接口(upload_file_to_obs / upload_stream_to_obs),招聘海报、公司 Logo 等多媒

2-Learning 6629 字
ocr_api

ocr_api.py ocr_api.py — PaddleOCR 封装类 初始化模型、长图智能切分(OpenCV 连通组件检测判断切线是否切到文字,切到了就上移)、结果缓存、GIF 兼容处理。切图算法详解见 00apiapi 主篇。 代码

2-Learning 6353 字
openai4o_api

openai4o_api.py openai4o_api.py — Azure OpenAI 接口(新版) AzureOpenAI 客户端 + call_gpt / call_gpt_system,处理招聘公告(ann)这种篇幅较长、结构松

2-Learning 1676 字
openai4o_api_0

openai4o_api_0.py openai4o_api_0.py — Azure OpenAI 接口(旧版) 依赖 openai==0.28 的历史版本,与 06openai4o_api新版 对照可看 SDK 重构升级路径。 代码 p

2-Learning 5824 字
quanzhi_api

quanzhi_api.py quanzhi_api.py — 云端数据同步接口 上传公告/职位数据到测试/正式环境;check_cloud 风控拦截(301 过期 / 302 黑名单 / 303 全文重复 / 304 链接重复);fix_

2-Learning 1264 字
qwen_api

qwen_api.py qwen_api.py — 通义千问接口封装 OpenAI 兼容调用方式(call_gpt),目前作为备用模型或实验性接口存在。 代码 python Please install OpenAI SDK first:

2-Learning 1619 字
data

data 这些 .ini 文件是一个招聘职位自动化抓取系统(Web Scraper / 爬虫系统)的底层配置文件。 简单来说,这是一个用来“指导”爬虫程序去各大公司官网或招聘平台(如腾讯、阿里、Cloudflare、IBM等)自动抓取招聘岗