ローカルLLM実行の土台となる推論エンジン。C/C++実装により、GPUがない普通のPCでもAIモデルを動かせる。
高スループットなLLM推論・サービングエンジン。PagedAttentionにより本番環境でのモデル配信コストを大きく下げる。