投稿日:2026.10.07 最終更新日:2026.10.07
マイクロソフト、リアルタイム文字起こしと多言語音声のAIを公開
ニュースの要点
マイクロソフトは2026年10月1日、リアルタイムの文字起こしと、多言語の音声生成を行うAIの計3モデルを公開しました。顧客対応や学習支援など、自然な音声のやり取りができるアプリケーションを開発するための提供です。
文字起こし「MAI-Transcribe-2-Streaming」は60言語に対応し、発言の途中からテキストを返します。音声生成「MAI-Voice-2.1」と高速版「MAI-Voice-2.1-Flash」は23言語に対応します。
同社の開発基盤「Microsoft Foundry」などで提供します。ただし、公式技術資料では、Foundry向けの文字起こしは公開プレビューです。サービス水準の保証がなく、本番業務には推奨しない試験提供の段階です。
ニュース出典: Microsoft AI/原題「Our first streaming transcription model debuts at no. 1 on Artificial Analysis」/2026-10-01/発表本文
イノベーション総研の考察
今回の発表で変わるのは、録音を処理する速さだけではありません。人が話している間に認識を進められることが、会話型サービスの作り方に関わります。どの処理が速くなり、業務のどこに待ち時間が残るのかを分けて考えます。
マイクロソフトは録音の処理から、会話中の応答へ進めた
会議の録音を後から文字にするサービスでは、音声の処理を待つ時間があっても、作業は続けられます。一方、電話で質問するサービスでは、相手が黙ったまま待つ時間が長いと、利用者は返答が来るのか分からなくなります。音声を扱う点は同じでも、必要な速さが異なります。
マイクロソフトは9月3日のMAI-Transcribe-2発表で、録音内の話者を区別する機能や、語ごとの時刻を付ける機能を紹介していました。今回のストリーミング版は、音声を受け取りながら暫定的な文字起こしを返し、後から文脈に合わせて更新する方式です。
今回の変化は、録音後に読む文字起こしから、会話中に使う文字起こしへ用途を広げたことです。
録音後の記録作成に加え、会話が続いている間の字幕表示や回答の準備にも使えるようになります。イノベーション総研は、既存の文字起こしを置き換えるだけでなく、利用者を待たせにくいサービスを開発するための部品を増やす動きと考えます。
文字起こしが速くても、業務の回答がすぐ出るとは限らない
音声で質問に答えるサービスは、声を文字にし、質問の意味を判断し、必要な情報を調べ、回答を声にする流れで動きます。今回のモデルが主に担うのは、入口の文字起こしと、出口の音声生成です。質問への回答を考える機能や、予約情報を確認する機能まで、この3モデルだけで完成するわけではありません。
例えば予約の問い合わせなら、話し手が日時を言い直す場合があります。暫定的な認識を使って空き状況を調べ始めることはできても、確定前の日時で予約を実行すると、誤操作につながります。準備を始める処理と、利用者の確認後に実行する処理を分ける必要があります。
文字起こしの速さと、正しい回答・操作までの速さは、別の指標で確かめます。
同社は低遅延や高い認識精度を説明していますが、実際の通話では通信、雑音、固有名詞、情報検索にも時間がかかります。導入を考える担当者の方は、モデル単体の比較に加え、話し終えてから役に立つ回答が返るまでの時間を測ると、顧客にとっての改善を判断しやすくなります。
音声AIの単価ではなく、解決した問い合わせ1件の費用を比べる
発表時の導入価格は、文字起こしが音声1時間あたり0.54米ドルで、年末までの設定です。音声生成は100万文字あたり22米ドル、Flash版は15米ドルとしています。音声時間と生成する文字数では料金の単位が違うため、一つの単価だけでサービス全体の費用は計算できません。
電話の問い合わせでは、長い沈黙、聞き直し、回答の読み直しが増えると処理量も変わります。さらに、回答を考えるAI、通信、記録の保管、人への引継ぎなどの費用が加わります。Flash版の音声単価が低いことだけで、問い合わせ対応の総費用が下がったとは言えません。
音声AIの採算は、モデルの単価ではなく、問い合わせを解決するまでの総費用で判断します。
自社で試すなら、同じ種類の問い合わせを対象に、解決した件数と、AI・通信・人の対応を含む費用を比べてください。聞き直しや人への引継ぎに加え、途中で通話をやめる割合や、次も同じ窓口を使うかを確認します。初回のデモで速いと評価されても、繰り返し使われなければ継続的な収益にはつながりません。
Foundryの文字起こしは試験提供で、本番導入の判断が残る
今回、注意したいのは提供段階です。Microsoft Learnの技術資料は、文字起こし機能を公開プレビューとし、サービス水準の保証がなく、本番業務には推奨しないと説明しています。公開されたことと、顧客対応を任せられる運用条件が整ったことは分けて考えます。
担当者の方が検証を始めるなら、まず社内の字幕表示など、誤認識があっても人が確認できる用途を選ぶ方法があります。実際の会話に近い音声で、表示の待ち時間、訂正の頻度、固有名詞の認識を比較し、公開プレビューの利用条件も確認します。
正式提供の条件と、実業務の待ち時間・解決率が、音声AIを顧客対応へ進める判断材料になります。
顧客との通話へ進める際は、提供段階の更新、利用できる地域、音声データの扱い、料金、障害時の引継ぎを確認する必要があります。次に追いたいのは、正式提供の条件が明らかになるか、また導入企業が回答までの待ち時間と問い合わせの解決率を公表するかです。速いという発表を、実際に使えるという判断へ変える材料になります。
まとめ
マイクロソフトの新モデルは、会話の途中から認識を進め、多言語で返答するサービスの開発を支えるものです。新規事業を検討する際は、単体の速さだけでなく、利用者が回答を得るまでの時間、問い合わせを解決する費用、任せられる運用条件を合わせて確かめることが重要です。
執筆:イノベーション総合研究所
CONTACT
お問い合わせ
音声AIを、使われるサービスへ
対象業務、試験導入、費用と運用条件を整理します。