Voxtral解説:文字起こし・音声Q&A・GPT-4o比較
Mistral Voxtralの3B/24Bモデル、32K文脈、音声要約と質問応答、ローカル配備、公平な比較方法を解説します。
更新

要点
- ASRと音声理解を一つにまとめます。
- 3Bと24BがApache 2.0で公開されています。
- 認識、推論、遅延、費用、証拠を分けて評価します。
従来ASRとの違い
Voxtralは音声から直接、質問応答、要約、関数呼び出しを行えます。誤りが認識・解釈・生成のどこか判別しにくいため、重要用途では文字起こしや時間証拠を残します。
3B・24B・32K文脈
Miniは約3B、Smallは約24Bで、公式は文字起こし約30分、理解約40分を示します。実際のローカル動作は量子化、メモリ、実装、冷却で変わります。
GPT-4o・Whisperと公平に比べる
文字起こしはWER/CER、要約は事実、Q&Aは根拠、対話は初回遅延で分けます。オープンウェイトのローカル配備とAPI価格も同じ指標ではありません。
音声理解が必要な場面
問い合わせ分析、取材調査、会議知識には有用です。明瞭な音声を文字にするだけなら、通常のASRの方が単純で検証しやすい場合があります。
配備前の安全確認
ライセンスとハッシュ、関数権限、入力制限、証拠保存、音声プロンプト注入を確認し、高リスク判断は人へ引き上げます。
よくある質問
Voxtralはオープンソースですか?
3Bと24Bの重みがApache 2.0で公開されています。利用時は個別成果物の条件を確認してください。
完全オフラインで動きますか?
対応ハードウェアがあればローカル実行できます。24Bは大きな資源が必要です。
GPT-4oより優れていますか?
一律には言えません。認識、音声理解、遅延、費用、言語、配備制御で比較します。