chu taskschd.msc 192.168.88.67 admin wangye!@123 1. 00parsegptparsegpt → 解析网页结构,用GPT生成爬虫模板 2. 00auto_genauto_gen/00auto_
链路追踪链路追踪 定时任务 !imagee83adfd1.png bat @echo off echo 正在启动中... call E:\chu\python310_ve\Scripts\activate.bat cd /d E:\chu\qzcl
全链路流程梳理全链路流程梳理:招聘数据自动化抓取 一、系统全景架构 !image62607bc7.png 二、启动阶段(定时任务 → 配置加载) 2.1 定时任务脚本 bat @echo off echo 正在启动中... call E:\chu\pyt
parsegptparsegpt 这是一套校招/社招公告的全链路解析系统,把爬取到的原始 HTML 页面转化为结构化 JSON,供后续搜索、展示、推荐使用。整体由五个模块分工协作,有一条明确的主干流程,也有两条独立的分支路径。 !image42313e76
ann_imgann_img.py ann_img.py — 图片处理与 OCR 组件 下载公告图片 → MD5/感知哈希去重 → 二维码识别(纯二维码/混合图/普通图)→ PaddleOCR 文字识别 → 多层黑名单过滤 → 上传华为云 OBS 替换
ann_mdann_md.py ann_md.py — HTML 预处理与 Markdown 转换 解析流水线的第一道关卡:清洗噪音 DOM → 修复链接/图片路径 → 硬编码字段提取 → 表格转 Markdown → 渠道专项修复。六件事详解见 00
ann_modelann_model.py ann_model.py — 核心调度器(主入口) 整个解析系统的大脑,串联所有模块:公告级解析 → 职位列表解析 → Markdown 格式处理三阶段,输出标准 JSON 模型文件。三阶段详解见 00parseg
ann_model_jobann_model_job.py ann_model_job.py — 公告内单职位解析 由 03ann_modelann_model 分支调用:HTML 转纯文本 → Qwen 大模型提取 → 校验质量 → 与公告元数据(公司名、链接、申
cjob_modelcjob_model.py cjob_model.py — 大公司职位详情页解析 独立入口(不经过 03ann_modelann_model):detail_selector 精准定位职位正文 → Header 区域提取职位类别/地点/人数
html_to_texthtml_to_text.py html_to_text.py — 底层 HTML 清洗 最底层工具,被多个上层模块调用:HTML 转纯文本,对 <table 按行合并保留表格语义,清理 CSS/JS/隐藏元素/ 等噪音。 代码
auto_genauto_gen 这是一个自动化的 HTML 列表解析系统,核心思路是"为每个网站生成专属的解析函数",用来从各大学就业网的公告列表页中批量提取招聘信息。 问题背景 每所学校的就业网页面结构都不一样,比如: gen_00001.py:找 u
func_callfunc_call.py func_call.py — 运行时调度器 importlib 动态加载指定的 gen_ 模块执行解析;结果为空自动触发 02func_gen_bygptfunc_gen_bygpt 让大模型重新生成。完整流程见
func_gen_bygptfunc_gen_bygpt.py func_gen_bygpt.py — 兜底生成器 解析结果为空时,把该学校的 HTML 样本发给大模型,自动生成新的 gen_func_code_{key}_tmp.py(幂等保护:文件已存在则跳过,不
gen_000xxgen_000xx.py gen_000xx.py — 学校专属解析函数(示例) 每所学校一个文件,实现统一接口 extract_table_from_htmlhtmlcontext, tempfile,输出统一 JSON(announce
auto_gen_comauto_gen_com 这是大公司招聘网站的爬虫自动化模块,和之前学校就业网的模块是同一套架构,但针对企业招聘页面做了扩展。对比来看: 与上一个模块的区别 学校就业网模块 大公司招聘模块(本模块) 目标 学校就业网公告列表 企业招聘网站职
click_50001click_50001.py click_50001.py — 页面交互函数 自动查找并点击"博士生招聘"标签/按钮:优先匹配 label,兜底匹配 span,防止页面结构变化导致点击失败。 代码 python def crawl_page
func_callfunc_call.py func_call.py — 运行时调度器(大公司版) 与 01func_callauto_gen 的 func_call 同源,面向大公司招聘页面的解析调度:动态加载解析函数 → 执行 → 结果为空触发大模型重新
func_gen_bygptfunc_gen_bygpt.py func_gen_bygpt.py — 兜底生成器(大公司版) 与 02func_gen_bygptauto_gen 的 func_gen_bygpt 同源:解析为空时把 HTML 样本发给大模型,自动生
gen_00001gen_00001.py gen_00001.py — 大公司专属解析函数(示例) 实现统一接口 extract_table_from_htmlhtmlcontext, tempfile 的大公司版解析函数。分工背景见 00auto_gen
page_00001page_00001.py page_00001.py — 页面交互函数(示例) 实现 crawl_page 页面处理函数(模拟点击/翻页等交互动作)的大公司版示例。 代码 python 进行翻页操作:点击下一页按钮 def crawl_p
auto_on_responseauto_on_response 这是针对兴业银行招聘网站的专项爬虫模块,采用了一种特殊的网络请求拦截方式来获取数据,而不是解析 HTML。 为什么要拦截网络请求 兴业银行的招聘页面是前后端分离的 SPA(单页应用),职位数据通过 Ajax
main_procmain_proc.py main_proc.py — 入口路由 根据 _key(公司编号)分发到专项处理函数:目前只有 com_91000(兴业银行)一个分支,后续新增特殊公司在这里加 elif 即可。设计背景见 00auto_on_re
xingye_procxingye_proc.py xingye_proc.py — 兴业银行专项爬虫 注册 Playwright 响应拦截器 → 自动翻页 → 捕获招聘 API 的 JSON 响应 → 字段映射 + generate_html 拼伪 HTML
auto_apiauto_api 这是大公司招聘API直连爬取模块,与之前兴业银行的"Playwright拦截响应"方式不同,这里大部分公司是直接调用其招聘后台API接口获取数据。 整体结构 baidu_data_proc_api.py 里的 api_pr
baidu_data_proc_apibaidu_data_proc_api.py baidu_data_proc_api.py — 百度招聘直连 api_proc 总入口所在文件。直接 POST 百度招聘后台 API 拿分页 JSON,带代理池(getProxy 递归重试取可
isoftstone_data_proc_apiisoftstone_data_proc_api.py isoftstone_data_proc_api.py — 软通动力直连 两套 API 响应格式自动适配(社招 code/data/list / 校招 results/count);详
jd_data_proc_apijd_data_proc_api.py jd_data_proc_api.py — 京东招聘直连 POST 接口拿职位 JSON,generate_job_html 把结构化数据拼成完整 HTML 落盘,无缝进入后续 ann_md → an
kingdee_data_proc_apikingdee_data_proc_api.py kingdee_data_proc_api.py — 金蝶 JS 文件解析 职位数据直接发布在静态 jobs.js 里(较少见的方案):正则从 JS 文本提取 jobs = ... 数组解析
picc_data_proc_apipicc_data_proc_api.py picc_data_proc_api.py — 中国人保直连(最全) 社招/校招/实习三条通道各自独立的取数 → 字段转换(transform)→ HTML 生成函数,体量是本模块最大的一个(超过
apiapi 这是一个非常典型的AI驱动的招聘数据抓取、解析与结构化处理系统。工作流涵盖了从非结构化数据(图片、长文本)输入,到通过多种大语言模型(LLMs)进行信息抽取与标准化,最后将数据同步至云端数据库的完整闭环。 一、 核心大模型(LLM)
deepseek_apideepseek_api.py deepseek_api.py — DeepSeek 接口封装 OpenAI 兼容调用方式(call_gpt),目前作为备用模型或实验性接口存在。模块分工见 00apiapi 主篇。 代码 python Pl
doubao_apidoubao_api.py doubao_api.py — 豆包大模型接口(核心) call_gpt / call_gpt_system 双接口;fix_return_json 清理大模型返回内容中的 Markdown json 代码围栏包
doubao_api_newdoubao_api_new.py doubao_api_new.py — 豆包接口(Prompt Caching 版) 火山引擎 DeepSeek 带上下文缓存:首次运行创建缓存并保存 response_id,本地 json 持久化 +
hwcloud_apihwcloud_api.py hwcloud_api.py — 华为云 OBS 上传 本地文件 / 二进制流两类上传接口(upload_file_to_obs / upload_stream_to_obs),招聘海报、公司 Logo 等多媒
ocr_apiocr_api.py ocr_api.py — PaddleOCR 封装类 初始化模型、长图智能切分(OpenCV 连通组件检测判断切线是否切到文字,切到了就上移)、结果缓存、GIF 兼容处理。切图算法详解见 00apiapi 主篇。 代码
openai4o_apiopenai4o_api.py openai4o_api.py — Azure OpenAI 接口(新版) AzureOpenAI 客户端 + call_gpt / call_gpt_system,处理招聘公告(ann)这种篇幅较长、结构松
openai4o_api_0openai4o_api_0.py openai4o_api_0.py — Azure OpenAI 接口(旧版) 依赖 openai==0.28 的历史版本,与 06openai4o_api新版 对照可看 SDK 重构升级路径。 代码 p
quanzhi_apiquanzhi_api.py quanzhi_api.py — 云端数据同步接口 上传公告/职位数据到测试/正式环境;check_cloud 风控拦截(301 过期 / 302 黑名单 / 303 全文重复 / 304 链接重复);fix_
qwen_apiqwen_api.py qwen_api.py — 通义千问接口封装 OpenAI 兼容调用方式(call_gpt),目前作为备用模型或实验性接口存在。 代码 python Please install OpenAI SDK first:
datadata 这些 .ini 文件是一个招聘职位自动化抓取系统(Web Scraper / 爬虫系统)的底层配置文件。 简单来说,这是一个用来“指导”爬虫程序去各大公司官网或招聘平台(如腾讯、阿里、Cloudflare、IBM等)自动抓取招聘岗