练手网站
练手网站
| 网站 | 适合练什么 | 地址 |
|---|---|---|
| Quotes to Scrape - JS | JS 渲染后的 DOM 抓取 | Quotes JS |
| Quotes to Scrape - JS Delayed | JS 延迟加载,练 waitForSelector |
Quotes JS Delayed |
| Quotes to Scrape - Scroll | 滚动加载 / 无限滚动 | Quotes Scroll |
| Web Scraper - AJAX | AJAX 分页 / 动态加载商品 | Web Scraper AJAX |
| Web Scraper - Load More | 点击“加载更多”后抓取 | Web Scraper Load More |
| Web Scraper - Infinite Scroll | 下拉滚动触发加载 | Web Scraper Scroll |
toscrape.com 本身就是专门做网页爬虫练习的 sandbox,其中 Quotes 系列提供了 JavaScript、延迟加载、滚动加载、登录、AJAX 表单等不同难度的练习入口;Web Scraper 的 Test Sites 也明确提供 AJAX 分页、Load more 按钮、滚动加载等电商练习站。
先练 Quotes JS。这个站最适合验证“普通 HTTP 请求拿不到完整数据,但浏览器渲染后能拿到”的区别。你可以先用 fetch 或 axios 请求页面,看 HTML 里有没有 quote 数据;然后再用 Playwright 打开页面,等 JS 执行完后从 DOM 里提取。
然后练Quotes JS Delayed。它的重点是“页面不是立刻出现数据”,所以你要学会等待元素出现,比如 Playwright 里的 page.waitForSelector()。
接着练 Web Scraper AJAX。它更接近真实网站,商品数据通过 AJAX、动态分页等方式加载,适合练“抓渲染后的 DOM”和“找接口请求”两种思路。
最后练 Quotes Scroll 或 Web Scraper Scroll,这类是无限滚动,需要你模拟滚动、等待新内容加载、去重、判断什么时候停止。
组内导航:⬅️ 练手 | 🏠 00-爬虫课程六讲 | ➡️ 从能跑到能稳定跑很久——爬虫的工程化跃迁
💬 评论