spec — 基本情報
| github_stars | 89.8k |
|---|---|
| pricing | open_source |
| license | Apache-2.0 |
| os | mac / windows / linux |
| japanese | 非対応 |
| difficulty | 上級 |
| recommended | 自前GPUでのLLM本番サービング |
概要
高スループットなLLM推論・サービングエンジン。PagedAttentionにより本番環境でのモデル配信コストを大きく下げる。
LLM推論サービングの事実上の標準エンジンです。PagedAttentionという発明によりGPUメモリの利用効率を劇的に改善し、同じハードウェアで数倍のスループットを実現しました。OpenAI互換APIサーバーとして起動できるため、既存アプリのバックエンドを自社GPUに切り替える移行も簡単です。
主な機能
- PagedAttentionによる高効率推論
- OpenAI互換APIサーバー
- 量子化・分散推論対応
料金
オープンソースとして無料で利用できます。
※詳細は公式サイトでご確認ください。
こんな人におすすめ
- 自前GPUでのLLM本番サービング
- 自社GPUでLLMをAPI提供したいインフラエンジニア
- 推論コストの最適化が課題のAIサービス運営者
よくある質問
Q. Ollamaとの違いは?
A. Ollamaは個人のローカル利用向けの手軽さ、vLLMは本番サービングの性能に最適化されています。多数の同時リクエストを捌くならvLLM一択です。
Q. どんなGPUが必要ですか?
A. NVIDIA GPUが主対象です。モデルサイズに応じたVRAMが必要で、量子化や複数GPU分散にも対応しています。
代替ツール
比較
glossary — わからない用語があったら
tags
related — 同カテゴリの人気エンティティ
スクリーンショットを渡すとそっくりなHTML/Reactコードを生成するツール。デザイン→コード変換の代表的OSS。
ChatGPT風UIのセルフホスト型チャットプラットフォーム。マルチプロバイダ・エージェント・RAGを1つのUIで扱える。
PythonだけでデータアプリのUIが作れるフレームワーク。分析ダッシュボードや社内ツールの定番。
ローカルLLM実行の土台となる推論エンジン。C/C++実装により、GPUがない普通のPCでもAIモデルを動かせる。
WebサイトをLLM向けデータに変換するスクレイピングAPI。クロール・抽出・検索をシンプルなAPIで提供する。