Crawl4AI 网页爬虫快速上手指南:3步跑通你的第一个爬虫

Crawl4AI 网页爬虫快速上手指南:3步跑通你的第一个爬虫 Crawl4AI 网页爬虫快速上手指南3步跑通你的第一个爬虫【免费下载链接】crawl4ai Crawl4AI: Open-source LLM Friendly Web Crawler Scraper. Dont be shy, join here: https://discord.gg/jP8KfhDhyN项目地址: https://gitcode.com/GitHub_Trending/craw/crawl4aiCrawl4AI 是一个面向大语言模型的开源网页爬虫与抓取工具装上之后一行代码就能把网页转成干净的 Markdown直接喂给 LLM 做分析。这篇文章给你讲清安装、第一次抓取和关键参数调优三件事每步都有可验证的成功标准照做即可跑通。第1步安装 Crawl4AI 并验证环境这一步解决装没装对的问题。在终端执行下面三条命令pip install -U crawl4ai crawl4ai-setup crawl4ai-doctorcrawl4ai-setup负责补齐浏览器运行依赖crawl4ai-doctor负责体检。看到 doctor 输出各检查项正常即算成功如果提示缺少浏览器依赖再手动执行python -m playwright install --with-deps chromium即可无需重装整个包。第2步写出第一个抓取脚本把下面这段存成first_crawler.py运行它演示了 Crawl4AI 的最小闭环启动一个无头浏览器不打开界面、后台运行的模式抓取页面并输出 Markdown。import asyncio from crawl4ai import AsyncWebCrawler async def main(): async with AsyncWebCrawler() as crawler: result await crawler.arun(urlhttps://example.com) print(result.success, result.markdown.raw_markdown[:500]) asyncio.run(main())看到终端先打印True、再打印页面标题和正文开头的 Markdown 文本就说明抓取成功了。不想写脚本也可以命令行工具crwl一行等价crwl https://example.com -o markdown终端直接流出该页的 Markdown 正文即为成功适合快速验证某个 URL 能不能抓。第3步调关键参数适配你的页面默认配置抓的是整页实际使用要靠参数把内容裁剪到位。两个配置类分工不同BrowserConfig管浏览器本身CrawlerRunConfig管每次抓取的行为。最常用的几项如下参数所在配置类作用cache_modeCrawlerRunConfig缓存模式BYPASS强制重新抓取ENABLED读写缓存excluded_tagsCrawlerRunConfig剔除nav、footer等干扰标签css_selectorCrawlerRunConfig只处理指定 CSS 选择器命中的区块delay_before_return_htmlCrawlerRunConfig返回 HTML 前等待毫秒数应对动态渲染headlessBrowserConfig是否无头运行默认就是Trueproxy_configBrowserConfig传server/username/password配置代理把配置组装起来大致长这样from crawl4ai import CrawlerRunConfig, CacheMode run_config CrawlerRunConfig( cache_modeCacheMode.BYPASS, excluded_tags[nav, footer, aside], css_selectorarticle, delay_before_return_html2000, screenshotFalse )运行后result.markdown.raw_markdown明显变短、只包含正文就是参数生效的标志。css_selector的写法就是平时在浏览器开发者工具里用的那套选择器。动态页面抓取两种等内容的办法遇到点一下才加载更多的页面光加等待时间不够需要让浏览器替你点。CrawlerRunConfig 的js_code参数接受一段 JavaScript在页面加载后自动执行配合delay_before_return_html留出走码时间。js_code const btn Array.from(document.querySelectorAll(button)) .find(b b.textContent.includes(Load More)); btn btn.click(); 抓取结果里出现新增条目说明点击生效了。如果目标只是页面加载慢而不是需要交互优先调大delay_before_return_html或timeout不用上 JavaScript。常见报错速查页面内容不完整先开java_script_enabledTrue默认已开启再调大delay_before_return_html多数懒加载页面到此就完整了。被网站拦截给BrowserConfig配proxy_config走代理或加simulate_userTrue模拟真人操作节奏两者可叠加。内存占用高关掉不用的screenshot、CSS 提取等产出项减少单次抓取的资源消耗。想确认到底哪步挂了crawl4ai-doctor能定位环境层问题脚本层错误看result.error_message。从安装到出结果只用了三条命令加一个 10 行脚本Crawl4AI 把浏览器自动化、内容清洗、Markdown 转换都收进了一个arun()调用里。想继续深入可以看 docs/md_v2/core/quickstart.md 里的完整参数说明或 PROGRESSIVE_CRAWLING.md 学习单页爬虫升级为多页深度爬取的写法。【免费下载链接】crawl4ai Crawl4AI: Open-source LLM Friendly Web Crawler Scraper. Dont be shy, join here: https://discord.gg/jP8KfhDhyN项目地址: https://gitcode.com/GitHub_Trending/craw/crawl4ai创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考