学习顺序

  • 先读 spider.py —— 理解整个基础设施,特别是文件管理和入库逻辑
  • 再读 spider_liepin.py toInstance() onResponese() —— 理解 Playwright + 接口拦截的核心模式
  • __getSpiderConditions() __selectItem() —— 理解条件驱动的抓取策略
  • 最后看 spider_yupao_clean.py —— 理解数据清洗/过期处理的设计

项目分区导航zhaogebanshang ⬅️ | 00-学习顺序 | ➡️ Spider.py基类深度解析