OpenAIの音声認識モデル。多言語の文字起こし・翻訳に対応し、日本語の精度も高い定番OSS。
Whisperを最大4倍高速化した再実装。同じ精度でメモリ消費も少なく、文字起こしの実運用での標準になっている。