Crawl4AI OSS

LLMフレンドリーなWebクローラー。ページをクリーンなMarkdownに変換し、AIパイプラインへの入力に最適化。

last-updated: 2026-08-23 · source: database

github_stars79.2k
pricingopen_source
licenseApache-2.0
osmac / windows / linux
llmsclaude / gpt / gemini / llama
japanese非対応
difficulty中級
recommendedRAG用データ収集、エージェントのWeb情報取得

概要

LLMフレンドリーなWebクローラー。ページをクリーンなMarkdownに変換し、AIパイプラインへの入力に最適化。

GitHubで爆発的にスターを集めた、LLM時代のWebクローラーの代表格です。従来のスクレイパーと違い「AIに読ませる」ことを前提に設計されており、ノイズを除去したクリーンなMarkdown出力、LLMベースの構造化抽出、非同期の高速クロールが揃っています。RAGのデータ収集パイプラインの定番部品になりました。

主な機能

料金

オープンソースとして無料で利用できます。

※詳細は公式サイトでご確認ください。

導入方法

pip install crawl4ai
crawl4ai-setup

こんな人におすすめ

よくある質問

Q. Firecrawlとの違いは?

A. Crawl4AIは完全OSSでセルフホストが前提、FirecrawlはマネージドAPI(OSS版もあり)です。運用の手間を取るか費用を取るかの選択になります。

Q. JavaScriptで描画されるサイトも取れますか?

A. Playwrightベースのブラウザクロールに対応しており、動的サイトも取得できます。

導入手順

pip install crawl4ai
crawl4ai-setup

Crawl4AIで作れるもの

Crawl4AIを使った作り方ガイドがあります。作りたいものから選んで、AIと一緒に作ってみましょう。

比較

LLM(大規模言語モデル)APIオープンソース(OSS)セルフホストGitHubAIエージェントRAG
#crawler#oss#python#rag