Crawl4AI
Crawl4AI 是面向 LLM 与 AI 代理的开源网络爬虫与抓取工具,可将任意网站转换为干净、适合 LLM 的 Markdown,用于 RAG、AI 代理与数据管道。既可免费自托管,也可通过单个密钥使用 Crawl4AI Cloud。
访问 unclecode/crawl4ai项目简介
Crawl4AI 是面向 LLM 与 AI 代理的开源网络爬虫和抓取工具。它能把网站转换为干净、适合 LLM 的 Markdown,供 RAG、AI 代理和数据管道使用。可以用 Python、CLI、Docker 和 MCP 免费自托管,也可以通过 Crawl4AI Cloud 使用一个 API 密钥来使用。
核心功能
- 生成适合 LLM 的干净 Markdown,包含标题、列表、表格、代码块与引用提示。支持通过 CSS、XPath、正则或 LLM 策略进行结构化数据提取,输出类型化 JSON。浏览器控制包括持久化配置文件、远程 CDP 连接、会话、代理、隐身模式,以及 Chromium、Firefox 和 WebKit。深度爬取支持 BFS、DFS、最佳优先策略、崩溃恢复、自适应爬取与 URL 发现。自托管方式包括 Python 库、CLI、Docker REST API、MCP 服务器、仪表板和演练场。Crawl4AI Cloud
适用场景
- 将干净的 Markdown 输入 RAG 管道和 AI 代理。使用 CSS、XPath、正则或 LLM 提取从网站提取类型化 JSON 记录。通过托管 API 运行网络搜索并获取直接答案。为数据管道和研究大规模爬取大量页面。
快速开始
- 通过 pip install -U crawl4ai 安装开源库,并运行 crawl4ai-setup。使用 Python 的 AsyncWebCrawler 获取 URL 并打印 result.markdown。云端使用时,获取 API 密钥,并用 Bearer 令牌调用托管的 scrape、search、answer 或 extract 端点。通过一行配置将云端 MCP 服务器添加到 Claude Code、Codex、Cursor 或 OpenCode 等代理中。
部署与要求
- 该库支持 Python 3.10 至 3.13。crawl4ai-setup 会安装并设置浏览器;如果失败,请手动安装 Playwright Chromium。Docker 服务器需要 CRAWL4AI_API_TOKEN;没有令牌时,它只能在其容器内响应。Crawl4AI Cloud 需要 API 密钥,并使用托管服务,而不需要自己运行浏览器或代理。
采用前须知
- 许可证:Apache-2.0。在使用、修改或分发项目前,请确认其具体条款。