Microsoft、“世界でもっとも高速・高精度で安価”とうたう音声認識モデルを発表、「MAI-Transcribe-2」/60言語の平均単語誤り率(WER)で比較対象中トップ、処理速度も向上
情報元:窓の杜 2026-09-07T05:45:00.000Z
情報元による記事紹介
米Microsoftは9月3日(現地時間)、新しい音声認識AIモデル「MAI-Transcribe-2」を発表した。同社はこれを“世界でもっとも高速・高精度で安価な音声認識モデル”とうたっており、「Gemini 3.5 Transcribe」や「GPT-Transcribe」、「Whisper V3-Large」、「Scribe v2」といった競合モデルを上回るとしている。
AIによる記事の要点
情報元の記事をもとに自動生成しています。誤りや省略が含まれる場合があります。詳細は元記事で確認してください。
【概要】 Microsoftは9月3日、新しい音声認識AIモデル「MAI-Transcribe-2」を発表した。同社は60言語での平均単語誤り率5.2%で競合モデルを上回り、処理速度も従来比で最大10倍高速化したと主張している。価格は1時間あたり0.10米ドルで、前世代比約72%の値下げとなっている。 【具体的なポイント】 ・**精度での優位性**:FLEURSベンチマークの60言語(日本語含む)評価で平均単語誤り率5.2%を達成し、比較対象モデル中で最良の成績を記録した。Artificial Analysisの第三者評価ではWERランキング2位(2.0%)となっている。 ・**処理速度の大幅向上**:OpenAIの「GPT-Transcribe」比で10倍、ElevenLabsの「Scribe v2」比で7倍、Googleの「Gemini 3.5 Transcribe」比で5倍の高速処理を実現しながら、精度でも上回るとしている。 ・**大幅な価格引き下げ**:1時間あたり0.10米ドルの価格設定は、前世代「MAI-Transcribe-1.5」の0.36米ドルから約72%の削減である。ただし2026年末までの期間限定価格である。 ・**対応言語と機能拡張**:60言語に対応し、話者分離、単語単位のタイムスタンプ、コードスイッチング(言語混在への対応)、言語自動判別などの機能を備えている。 ・**ノイズ耐性の強化**:騒音の多い環境でも文字起こし品質を維持できるよう耐ノイズ性を継続強化している。 ・**想定用途**:診療記録、法務文書作成、アクセシビリティ、クローズドキャプションなどが挙げられている。 ・**利用可能な環境**:「Microsoft Foundry」「MAI Playground」「OpenRouter」で試用可能である。 【注目点】 処理速度と精度の両立を実現しながら大幅な価格引き下げを行った点が、市場での競争力を大きく高める要因となる。ただし期間限定価格であるため、2026年末以降の価格体系の変更に注意が必要である。 --- **用語説明** **MAI-Transcribe-2|Microsoftが開発した音声をテキストに変換するAIモデルの最新版** **単語誤り率(WER)|音声認識の精度を測る指標で、認識結果と正解の差分を単語数で表した値。低いほど精度が高い** **コードスイッチング|会話の途中で複数の言語が混在する状況に対応する機能** **FLEURS|複数言語の音声認識モデルを評価するベンチマークテスト**