OSS探訪

Whisper — 多言語の文字起こし・英語翻訳・言語識別を行う音声認識モデル

発掘スコア 311.9OSS健全度 63
スコアの見方

発掘スコアはStars・Watchers・Forks・Contributorsを対数圧縮して重み付けした独自指標(上限なし)。成長モメンタムは観測期間内の同スコアの差、OSS健全度は取得できた更新状況・Community Health・Releaseの0〜100評価です。

Stars
108,957
主要言語
Python
ライセンス
MIT
リポジトリ最終更新
2026/08/31

概要

Whisperは、多様な音声データで学習された汎用音声認識モデルです。一つのTransformerモデルで、多言語の音声認識、非英語音声から英語への翻訳、言語識別を扱い、CLIとPython APIから利用できます。

公式資料に基づく紹介・実機未検証 · 内容確認日:

音声を文字へ変換し、言語識別と英語翻訳も扱う

複数の音声処理タスクをtoken列の予測として統一し、音声ファイルの文字起こし、話されている言語の識別、多言語モデルによる英語翻訳を実行します。モデルはtinyからlarge、速度を重視したturboまで選べ、CLIとPythonの両方に利用例があります。

出典:[1]

多言語音声をローカル処理へ組み込みたい場合

録音や動画の文字起こし、言語判定、非英語音声の英語化をバッチ処理やPythonアプリへ組み込みたい用途の候補です。精度、速度、必要VRAMに応じてモデルサイズを選択できます。

出典:[1]

モデルごとのメモリと言語別精度、翻訳対応を確認する

README記載の必要VRAMはモデルにより約1〜10GBで、実速度と精度は言語、話速、ハードウェアで変わります。turboは翻訳用に学習されていないため、英語翻訳にはtiny、base、small、medium、largeの多言語モデルを使います。実行環境にはPython、PyTorch関連パッケージ、ffmpegが必要です。

出典:[1]

参考にした公式資料

  1. [1]Whisper README(2026-09-13)
編集部からの補足

topics未設定でも企業ブランドと論文が送客し、複数の高速化・移植プロジェクトがWhisperの検索面を広げる例として選びました。

成長の推移

直近30日

108,957 Stars

推移データを蓄積中です。

Built with

  • Python

カテゴリとタグ

GitHubのデータGitHubの詳細データを見る
Stars
108,957
Forks
13,205
Watchers
783
Open Issues
0
Contributors
83
主要言語
Python
ライセンス
MIT
リポジトリ最終更新
2026/08/31
情報の誤りを報告

掲載内容に誤りや古い情報があればお知らせください。