spec — 基本情報
| github_stars | 107.8k |
|---|---|
| pricing | open_source |
| license | MIT |
| os | mac / windows / linux |
| japanese | 完全対応 |
| difficulty | 初級 |
| recommended | 音声・動画の文字起こし自動化 |
概要
OpenAIの音声認識モデル。多言語の文字起こし・翻訳に対応し、日本語の精度も高い定番OSS。
OpenAIが公開した音声認識モデルで、公開から時間が経った今も文字起こしOSSの第一選択であり続けています。日本語の認識精度が高く、句読点も自然に付与されるため、議事録・字幕・インタビュー起こしの自動化に広く使われています。派生の高速化実装(faster-whisper等)も充実したエコシステムがあります。
主な機能
- 99言語対応の音声認識
- 翻訳・タイムスタンプ出力
- モデルサイズを選択可能
料金
オープンソースとして無料で利用できます。
※詳細は公式サイトでご確認ください。
こんな人におすすめ
- 音声・動画の文字起こし自動化
- 会議・動画・インタビューの文字起こしを自動化したい人
- 音声入力を組み込んだアプリを作る開発者
よくある質問
Q. リアルタイム認識はできますか?
A. 本来はバッチ処理向けですが、ストリーミング対応の派生実装を使えば準リアルタイムの用途にも対応できます。
Q. APIとローカルどちらで使うべき?
A. 少量ならOpenAIのAPIが手軽、大量・機密データならローカル実行(GPUがあれば高速)が経済的です。
比較
glossary — わからない用語があったら
tags
related — 同カテゴリの人気エンティティ
screenshot-to-code OSS
スクリーンショットを渡すとそっくりなHTML/Reactコードを生成するツール。デザイン→コード変換の代表的OSS。
stars: 74.4k price: freemium license: MIT ja: none level: beginner
LibreChat OSS
ChatGPT風UIのセルフホスト型チャットプラットフォーム。マルチプロバイダ・エージェント・RAGを1つのUIで扱える。
stars: 42.4k price: open_source license: MIT ja: partial level: intermediate
Streamlit OSS
PythonだけでデータアプリのUIが作れるフレームワーク。分析ダッシュボードや社内ツールの定番。
stars: 45.6k price: open_source license: Apache-2.0 ja: partial level: beginner
llama.cpp OSS
ローカルLLM実行の土台となる推論エンジン。C/C++実装により、GPUがない普通のPCでもAIモデルを動かせる。
stars: 125.3k price: open_source license: MIT ja: none level: advanced
Firecrawl OSS
WebサイトをLLM向けデータに変換するスクレイピングAPI。クロール・抽出・検索をシンプルなAPIで提供する。
stars: 171.3k price: freemium license: AGPL-3.0 ja: none level: beginner