Whisper OSS

OpenAIの音声認識モデル。多言語の文字起こし・翻訳に対応し、日本語の精度も高い定番OSS。

last-updated: 2026-08-23 · source: database

github_stars107.8k
pricingopen_source
licenseMIT
osmac / windows / linux
japanese完全対応
difficulty初級
recommended音声・動画の文字起こし自動化

概要

OpenAIの音声認識モデル。多言語の文字起こし・翻訳に対応し、日本語の精度も高い定番OSS。

OpenAIが公開した音声認識モデルで、公開から時間が経った今も文字起こしOSSの第一選択であり続けています。日本語の認識精度が高く、句読点も自然に付与されるため、議事録・字幕・インタビュー起こしの自動化に広く使われています。派生の高速化実装(faster-whisper等)も充実したエコシステムがあります。

主な機能

料金

オープンソースとして無料で利用できます。

※詳細は公式サイトでご確認ください。

こんな人におすすめ

よくある質問

Q. リアルタイム認識はできますか?

A. 本来はバッチ処理向けですが、ストリーミング対応の派生実装を使えば準リアルタイムの用途にも対応できます。

Q. APIとローカルどちらで使うべき?

A. 少量ならOpenAIのAPIが手軽、大量・機密データならローカル実行(GPUがあれば高速)が経済的です。

比較

APIオープンソース(OSS)ローカルLLM
#japanese-friendly#oss#speech#transcription