--- title: "10-data" created: 2026-04-02 tags: - 项目 aliases: - data --- # data 这些 `.ini` 文件是一个**招聘职位自动化抓取系统(Web Scraper / 爬虫系统)的底层配置文件**。 简单来说,这是一个用来“指导”爬虫程序去各大公司官网或招聘平台(如腾讯、阿里、Cloudflare、IBM等)自动抓取招聘岗位信息的任务清单和规则库。 以下是对这些配置文件核心作用和参数的详细拆解: ### 核心作用 这个系统通过读取这些配置,实现了对不同公司招聘页面的**定制化抓取**。因为每个公司的招聘网站结构都不同,系统需要知道: 1. 去哪里抓取?(社会招聘、校园招聘、实习生招聘的链接) 2. 用哪套规则解析网页?(对应的 `template` 和 `func_name`) 3. 抓取后归属到哪个公司名下?(公司名称、Logo等基本信息) --- ### 配置参数解析 我们将每个公司节点(如 `com_00289`)里包含的 JSON 字段拆开来看,它们分别代表了爬虫运行所需的具体指令: | **字段名** | **具体含义与作用** | **示例解读** | | --- | --- | --- | | `com_name` **/** `com_webname` | 公司全称与前端展示名称 | `腾讯控股有限公司` / `腾讯招聘` | | `com_logo` | 公司Logo的图片链接 | 抓取后展示在自建平台上的企业图标 | | `urls` | **核心抓取目标库**,按招聘类型分类的URL集合 | `shezhao` = 社招 `xiaozhao` = 校招 `shixi` = 实习 | | `pre_open_url` | 预加载链接 / 初始访问链接 | 用于绕过反爬或加载初始 Cookie/Token 的入口页面 | | `template` | 页面结构解析模板 | `template_50075`(告诉程序用哪套HTML/JSON解析规则去提取职位名、薪资、要求等) | | `func_name` | 绑定的自定义 Python/抓取函数名 | `gen_50181`(针对特殊反爬或复杂翻页逻辑写的专属执行脚本) | | `json_domain` | 接口请求的根域名 | 很多现代招聘网站使用前后端分离,爬虫可能直接去请求该域名下的 JSON 接口 | | `hd_all_location` | 岗位覆盖的城市/地区字典 | 用于在抓取时匹配或标准化工作地点(如将“京”映射为“北京”) | | `max_parent_level` / `click_type` | 爬虫行为控制参数 | 控制爬虫向下钻取的层级,或定义模拟点击的方式(如 `current` 表示在当前页操作) | --- ### 系统工作流程推演 基于这些配置,该爬虫系统的工作流程大概是这样的: 1. **任务调度**:系统读取 `setting_com_01.ini` 到 `05.ini`,获取所有需要抓取的公司列表(从 `com_00289` 到 `com_00468` 等)。 2. **执行路由**:针对某一家公司(例如 `com_00336` 阿里巴巴),系统先访问 `pre_open_url` 获取页面权限。 3. **定向抓取**:依次遍历 `urls` 里的社招、校招链接。 4. **数据解析**:调用对应的 `func_name` (如 `gen_50216`) 和 `template` (如 `template_50090`),将网页中的非结构化职位数据转化为结构化的 JSON 数据。 5. **入库展示**:将带有 `com_name` 和 `com_logo` 的职位数据存入你自己的数据库,供用户搜索。 **总结来说,这是一个架构非常成熟、高度模块化的分布式招聘爬虫配置中心。** 只要往里面新增类似的节点信息,爬虫就能立刻开始抓取新公司的职位数据,而无需大规模修改主程序代码。 --- **项目分区导航**:[[09-qwen_api|qwen_api]] ⬅️ | 10-data | ➡️ [[00-SpringBoot框架课|00-SpringBoot框架课]]