简历-实习经历

2026.03 - 2026.06 北京全聘致远科技有限公司 全栈实习生

参与招聘数据采集与结构化系统研发维护,系统面向学校就业公告、企业招聘官网、招聘平台与微信公众号等多源招聘数据,支撑公司招聘数据生产,覆盖采集、清洗、结构化处理与入库等环节。本人主要负责企业职位与招聘平台采集模块开发,以及部分内容标准化、去重质控和运行维护工作。

技术栈:Python、Playwright、Requests、BeautifulSoup、PaddleOCR、PyZbar、Markdown、HTTP/REST、JSON、PyInstaller

· 参与多渠道职位采集任务开发:参与大公司官网、学校就业中心等多渠道职位数据采集任务开发,根据不同站点的页面结构和数据来源,配合使用静态 HTML 解析、接口数据获取、Playwright 动态渲染、接口响应监听等方式完成职位列表与详情数据采集;在动态页面场景中,通过 page.on("response") 获取接口返回的结构化 JSON 数据,并结合 DOM 解析补全详情字段。 · 协助优化采集稳定性与页面加载性能:协助维护 Playwright 浏览器采集流程,处理页面加载超时、跳转异常、验证页、空数据等常见问题,提升长时间任务运行的稳定性;在已有浏览器上下文配置基础上,参与优化资源加载策略,通过屏蔽图片、字体、媒体等非核心资源减少页面加载耗时和代理流量消耗,使部分页面加载速度提升约 2 - 5 倍;配合对接内部代理池服务,参与代理获取、使用记录上报、异常切换等流程开发,减少单一代理异常对采集任务的影响。 · 参与断点续抓与任务状态维护:参与重点公司维度任务的断点续抓能力建设,基于 spider_status_.json 记录“地区 × 职位类别 × 工作经验 × 薪资”等条件组合的抓取进度;通过临时文件写入、JSON 校验、备份恢复等方式降低异常中断导致的进度丢失风险。 · 参与“先文件、后接口”的采集入库流程开发:采集结果先保存为本地 JSON 文件,再调用内部 jobparse、comparse 接口完成解析入库;根据接口返回结果进行 success、failed、expired 状态归档,并支持失败任务重跑和问题追溯。 · 负责职位清洗与有效性校验脚本开发:负责大公司职位链接有效性校验脚本的开发与维护,支持识别 404、招满、页面异常、安全验证等多种状态,并通过内部接口回写失效职位;通过浏览器上下文复用、异常重试、多选择器兼容等优化,使验证吞吐量较初版提升约 3 倍。 · 参与脚本打包部署与 AI 协同开发:通过 PyInstaller 将部分脚本打包为独立 exe,配合批处理脚本实现多实例分片运行;在开发过程中结合 AI 编程工具辅助完成代码生成、日志分析、脚本重构和文档整理,并通过人工 Review、本地测试和线上验证保障交付质量。