vLLM OSS

高スループットなLLM推論・サービングエンジン。PagedAttentionにより本番環境でのモデル配信コストを大きく下げる。

last-updated: 2026-08-23 · source: database

github_stars89.8k
pricingopen_source
licenseApache-2.0
osmac / windows / linux
japanese非対応
difficulty上級
recommended自前GPUでのLLM本番サービング

概要

高スループットなLLM推論・サービングエンジン。PagedAttentionにより本番環境でのモデル配信コストを大きく下げる。

LLM推論サービングの事実上の標準エンジンです。PagedAttentionという発明によりGPUメモリの利用効率を劇的に改善し、同じハードウェアで数倍のスループットを実現しました。OpenAI互換APIサーバーとして起動できるため、既存アプリのバックエンドを自社GPUに切り替える移行も簡単です。

主な機能

料金

オープンソースとして無料で利用できます。

※詳細は公式サイトでご確認ください。

こんな人におすすめ

よくある質問

Q. Ollamaとの違いは?

A. Ollamaは個人のローカル利用向けの手軽さ、vLLMは本番サービングの性能に最適化されています。多数の同時リクエストを捌くならvLLM一択です。

Q. どんなGPUが必要ですか?

A. NVIDIA GPUが主対象です。モデルサイズに応じたVRAMが必要で、量子化や複数GPU分散にも対応しています。

代替ツール

比較

LLM(大規模言語モデル)APIオープンソース(OSS)ローカルLLM
#gpu#inference#oss#production