【音声文字起こし】xAI「Grok Voice Transcribe 2.0」発表!1時間0.10ドルで精度2倍の衝撃【2026年9月18日発表】

今回は、新モデル「Grok Voice Transcribe 2.0 (グロック・ボイス・トランスクライブ・ニーテンゼロ)」をご紹介します。
2026年9月18日に、xAI(エックス・エーアイ)の新しい音声文字起こしAIとして正式発表されました。
1時間の音声を約0.10ドルで処理しながら、旧型の約2倍の精度をうたっています。
精度、速度、料金、マニアックな機能まで確認して、本当に音声入力の常識が変わるのか整理します。
【音声文字起こし】xAI「Grok Voice Transcribe 2.0」発表!1時間0.10ドルで精度2倍の衝撃【2026年9月18日発表】
Grok Voice Transcribe 2.0とは
まずは、このAIの正体から見ていきましょう。
「Grok Voice Transcribe 2.0」は、音声を文字へ変換するAIモデルです。
録音済みのファイルと、リアルタイムの音声入力に対応します。
普通のGrokへ新しい録音ボタンが増えた、という話ではありません。
開発者がアプリやサービスへ組み込むためのAPIです。
会議の議事録、動画の字幕、コールセンター、音声操作などに使えます。
その土台は、Grokの音声会話を支えるオーディオ基盤モデルです。
xAIによると、実際の通話や騒音、多言語の音声を使って訓練しています。
きれいなスタジオ音声だけで、成績を稼ぐモデルではありません。
電話回線、訛り、複数人の声が飛び交う現場を狙っています。
正直、文字起こしAIで本当に欲しいのは、まさにこの方向です。
精度は本当に2倍なのか
ここからは、一番気になる精度を見ていきます。
xAIは、旧型と同じ価格で約2倍の精度になったと説明しています。
この数字は、xAIが実環境の音声で行った社内評価が中心です。
評価したのは、電話、Grokとの会話、認証情報、短い音声命令です。
電話番号やメールアドレスまで、独立した試験項目になっています。
ここ、地味に見えてめちゃくちゃ重要です。
文章が多少違っても、会議の意味は推測できます。
電話番号が1桁違うと、もう別の人につながります。
外部のArtificial Analysisにも、興味深い結果があります。
バッチ処理の総合WERは、旧型の4.0%から2.3%へ低下しました。
WERは、単語の誤りが少ないほど低くなる指標です。
つまり外部評価でも、名前だけの2.0ではありません。
バッチ版では「Scribe v2」の2.2%がわずかに上です。
一方、xAIが強調した1位は、32モデルを比べたストリーミング部門です。
条件を分けて見ると、実力と宣伝の境界がきれいに見えます。
騒音と多言語に強い
次は、現実の音声で効く進化です。
「Grok Voice Transcribe 2.0」は、数十言語を自動判定します。
さらに、録音の途中で言語が変わっても追従します。
日本語の会議で、製品名だけ英語になる場面も珍しくありません。
話すたびに言語設定を切り替えなくてよいのは、かなり実用的です。
xAIの19言語による短文評価では、WERが20.6%から6.8%へ下がりました。
約3分の1まで減った計算です。
短い音声は、実は長い会話より言語判定が難しくなります。
「エアコンを22度にして」だけでは、前後の文脈がありません。
それでも正しく拾えるなら、車や家電の音声操作と相性抜群です。
Grok Voiceは、すでにTesla車内のGrokにも使われています。
走行音の中で短い命令を聞き取る訓練は、ここで効いてきます。
机の上のデモではなく、走る車の中で鍛えられているわけです。
機能が全部入り
精度だけでなく、周辺機能もかなり攻めています。
まず、単語ごとの開始時間と終了時間を取得できます。
字幕を音声へピタッと合わせたい動画制作者には、たまらない機能です。
話者分離を使えば、誰が話したのかも自動でラベル付けできます。
さらに、最大8チャンネルを個別に文字起こしできます。
コールセンターなら、顧客と担当者の音声を別々に処理できます。
最大100個の重要語も、事前に指定できます。
1語あたり最大50文字です。
製品名、社名、医療用語などを、優先して認識させられます。
「Grok」が「グロック」になる事故も、減らせる可能性があります。
数字、日付、通貨、電話番号、メールも読みやすく整形します。
「えー」や「あー」などのフィラーは、初期設定で自動除去されます。
逆に会話分析で必要なら、残す設定もできます。
対応する音声形式は12種類です。
MP3、WAV、M4A、FLAC、AACなどを扱えます。
ここまで揃うと、文字起こしというより音声データの解体装置です。
音声AIを自然にする仕組み
ここからは、さらにマニアックな機能です。
ストリーミングでは、約500ミリ秒ごとに暫定結果を返せます。
話している途中から文字が伸びていく、ライブ字幕を作れます。
無音が400ミリ秒続くと、発話終了を判定するのが初期設定です。
さらに「Smart Turn」という終了判定も利用できます。
単なる無音ではなく、話が終わった確率をAIが判断します。
人は考えている途中でも、普通に一瞬黙ります。
その間にAIが割り込むと、会話は一気にポンコツ感が出ます。
Smart Turnは、その気まずいフライングを減らすための機能です。
声として扱う強さのしきい値まで調整できます。
小さな声を拾うか、雑音を無視するかを用途に合わせられます。
電話回線では低め、騒がしい会場では高め、という調整が可能です。
こういう地味な制御が、音声AIの使い心地を大きく変えます。
料金がかなり安い
では、導入したくなる料金を見ていきましょう。
録音済み音声のバッチ処理は、1時間0.10ドルです。
リアルタイム処理は、1時間0.20ドルです。
10時間の動画をまとめて処理しても、バッチなら1ドルです。
1,000時間でも、100ドルに収まります。
話者分離、単語の時刻、重要語の指定も、この料金に含まれます。
2026年9月19日時点で、「ElevenLabs Scribe v2」は1時間0.22ドルです。
リアルタイム版は、1時間0.39ドルです。
Deepgramの「Nova-3」は、録音済み音声で1時間約0.26ドルからです。
機能条件は同一ではありませんが、xAIの安さは明確です。
しかも旧型から値上げせず、精度を大きく上げています。
これはアツイですね。
文字起こしを節約対象から、常時オンの機能へ変えられる価格です。
Loomが全動画へ採用
性能表だけでなく、すでに大規模な採用例もあります。
画面録画サービスの「Loom」は、全動画の文字起こしに採用しました。
既存の文字起こしより正確だったことが、採用理由です。
ここから先の使い方が、個人的には一番ワクワクします。
画面を録画しながら、直してほしい部分を声で説明します。
その文字起こしをCursorへ渡し、コードまで自動修正させます。
つまり、キーボードで指示書を書く必要がありません。
画面を見せて話すだけで、作業そのものが進みます。
動画制作者なら、収録した声から字幕と概要を同時に作れます。
会議なら、話者別の議事録から担当者と期限を抽出できます。
通話なら、電話を切る前に内容をCRMへ送れます。
文字起こしがゴールではなく、AIを動かす入力装置になるわけです。
音声が、キーボードより速い命令インターフェースへ変わります。
導入前の注意点
ここで、期待値を冷静に調整しておきましょう。
第一に、今回はAPIモデルの発表です。
一般ユーザー向けの完成した文字起こしアプリではありません。
APIキーの取得や、サービスへの組み込みが必要です。
第二に、多言語対応と日本語の精度は同じ意味ではありません。
公式APIでは、日本語を表す「ja」を指定できます。
一方、日本語だけの詳細なWERは公開されていません。
専門用語の多い日本語動画では、実音声による確認が必要です。
第三に、2倍という表現はxAIの社内評価が中心です。
外部評価でも進化は確認できますが、全条件で2倍とは限りません。
そして現在、モデルを省略すると旧型が選ばれます。
使う場合は、「grok-voice-transcribe-2.0」を明示する必要があります。
xAIは、まもなく2.0を標準モデルへ切り替える予定です。
旧型の1.0は、今後数週間で廃止される見込みです。
結論
最新情報を確認した結果、結論が出ました。
- 動画や会議を大量に処理するなら、バッチ版がオススメです。
- ライブ字幕や音声AIを作るなら、ストリーミング版がオススメです。
- 日本語の完成アプリが欲しい人は、対応サービスの登場を待つべきです。
「Grok Voice Transcribe 2.0」の魅力は、精度だけではありません。
高精度、話者分離、時刻情報、重要語指定を、1時間0.10ドルに詰め込みました。
安いから試せるのではなく、安いから常時使えるのが強みです。
録音のたびに料金を気にせず、すべての音声をAIの入力へ変えられます。
私の一言コメントは、文字起こしAIの価格破壊が始まった、です。
もし自分の制作環境へ入れるなら、まず過去動画をまとめて処理したいですね。
字幕だけでなく、全動画を検索できる自分専用データベースを作れます。
何百時間もの声が、一気に使える知識へ変わるのは夢があります。
「Grok Voice Transcribe 2.0」は、開発者や大量の音声を扱う人にオススメです。
最後に
今回は、新モデル「Grok Voice Transcribe 2.0」についてご紹介しました。
皆さんなら、会議、動画、音声操作のどれに使いたいですか?
作ってほしい機能と一緒に、ぜひコメント欄で教えてください。
この動画が参考になった方は、高評価・チャンネル登録をお願いします。
それではまた、次回の動画でお会いしましょう!