spec — 基本情報
| github_stars | 79.2k |
|---|---|
| pricing | open_source |
| license | Apache-2.0 |
| os | mac / windows / linux |
| llms | claude / gpt / gemini / llama |
| japanese | 非対応 |
| difficulty | 中級 |
| recommended | RAG用データ収集、エージェントのWeb情報取得 |
概要
LLMフレンドリーなWebクローラー。ページをクリーンなMarkdownに変換し、AIパイプラインへの入力に最適化。
GitHubで爆発的にスターを集めた、LLM時代のWebクローラーの代表格です。従来のスクレイパーと違い「AIに読ませる」ことを前提に設計されており、ノイズを除去したクリーンなMarkdown出力、LLMベースの構造化抽出、非同期の高速クロールが揃っています。RAGのデータ収集パイプラインの定番部品になりました。
主な機能
- 高速な非同期クローリング
- LLM向けMarkdown出力
- CSSセレクタ/LLMベースの構造化抽出
- セッション管理・プロキシ対応
料金
オープンソースとして無料で利用できます。
※詳細は公式サイトでご確認ください。
導入方法
pip install crawl4ai
crawl4ai-setup
こんな人におすすめ
- RAG用データ収集、エージェントのWeb情報取得
- RAGシステムのデータ収集を内製したい開発者
- APIのないサイトから構造化データを取得したい人
よくある質問
Q. Firecrawlとの違いは?
A. Crawl4AIは完全OSSでセルフホストが前提、FirecrawlはマネージドAPI(OSS版もあり)です。運用の手間を取るか費用を取るかの選択になります。
Q. JavaScriptで描画されるサイトも取れますか?
A. Playwrightベースのブラウザクロールに対応しており、動的サイトも取得できます。
導入手順
pip install crawl4ai
crawl4ai-setupCrawl4AIで作れるもの
Crawl4AIを使った作り方ガイドがあります。作りたいものから選んで、AIと一緒に作ってみましょう。
比較
glossary — わからない用語があったら
tags
related — 同カテゴリの人気エンティティ
スクリーンショットを渡すとそっくりなHTML/Reactコードを生成するツール。デザイン→コード変換の代表的OSS。
ChatGPT風UIのセルフホスト型チャットプラットフォーム。マルチプロバイダ・エージェント・RAGを1つのUIで扱える。
PythonだけでデータアプリのUIが作れるフレームワーク。分析ダッシュボードや社内ツールの定番。
ローカルLLM実行の土台となる推論エンジン。C/C++実装により、GPUがない普通のPCでもAIモデルを動かせる。
WebサイトをLLM向けデータに変換するスクレイピングAPI。クロール・抽出・検索をシンプルなAPIで提供する。