概要
Whisperは、多様な音声データで学習された汎用音声認識モデルです。一つのTransformerモデルで、多言語の音声認識、非英語音声から英語への翻訳、言語識別を扱い、CLIとPython APIから利用できます。
公式資料に基づく紹介・実機未検証 · 内容確認日:
音声を文字へ変換し、言語識別と英語翻訳も扱う
複数の音声処理タスクをtoken列の予測として統一し、音声ファイルの文字起こし、話されている言語の識別、多言語モデルによる英語翻訳を実行します。モデルはtinyからlarge、速度を重視したturboまで選べ、CLIとPythonの両方に利用例があります。
出典:[1]
多言語音声をローカル処理へ組み込みたい場合
録音や動画の文字起こし、言語判定、非英語音声の英語化をバッチ処理やPythonアプリへ組み込みたい用途の候補です。精度、速度、必要VRAMに応じてモデルサイズを選択できます。
出典:[1]
モデルごとのメモリと言語別精度、翻訳対応を確認する
README記載の必要VRAMはモデルにより約1〜10GBで、実速度と精度は言語、話速、ハードウェアで変わります。turboは翻訳用に学習されていないため、英語翻訳にはtiny、base、small、medium、largeの多言語モデルを使います。実行環境にはPython、PyTorch関連パッケージ、ffmpegが必要です。
出典:[1]
参考にした公式資料
- [1]Whisper README(2026-09-13)
編集部からの補足
topics未設定でも企業ブランドと論文が送客し、複数の高速化・移植プロジェクトがWhisperの検索面を広げる例として選びました。
成長の推移
直近30日
108,957 Stars
推移データを蓄積中です。
Built with
- Python
カテゴリとタグ
GitHubのデータGitHubの詳細データを見る
- Stars
- 108,957
- Forks
- 13,205
- Watchers
- 783
- Open Issues
- 0
- Contributors
- 83
- 主要言語
- Python
- ライセンス
- MIT
- リポジトリ最終更新
- 2026/08/31
あわせて探訪
- Ollama180,764 Stars
オープンモデルをPCやサーバーで取得・実行し、CLIとローカルAPIから利用するランタイム。
Go - Transformers165,220 Stars
テキスト・画像・音声・マルチモーダルの学習済みモデルを推論と学習で扱うPythonフレームワーク。
Python - AUTOMATIC1111 Stable Diffusion WebUI164,915 Stars
Stable Diffusionの画像生成・編集、モデル切替、拡張、APIをブラウザで操作するGradio製UI。
Python - Dify155,555 Stars
AIワークフロー、RAG、エージェント、モデル管理、観測を視覚的に統合するLLMアプリ開発基盤。
TypeScript - LangChain146,205 Stars
モデル・ツール・検索基盤などを共通インターフェースでつなぐ、LLMアプリとエージェント向けPythonフレームワーク。
Python
情報の誤りを報告
掲載内容に誤りや古い情報があればお知らせください。