#inference (2)

llama.cpp OSS

ローカルLLM実行の土台となる推論エンジン。C/C++実装により、GPUがない普通のPCでもAIモデルを動かせる。

stars: 125.3k price: open_source license: MIT ja: none level: advanced
vLLM OSS

高スループットなLLM推論・サービングエンジン。PagedAttentionにより本番環境でのモデル配信コストを大きく下げる。

stars: 89.8k price: open_source license: Apache-2.0 ja: none level: advanced