SenseVoice中日韓文字起こしガイド:速度・精度・Whisper比較
SenseVoice Smallの中国語・日本語・韓国語認識、音声イベント、Apple Silicon性能、公平な比較方法を解説します。
更新

要点
- ASRに言語・感情・音声イベント分類を加えたモデルです。
- 速度は端末、実行環境、量子化、音声長で変わります。
- 日本語はCERと固有名詞を個別に評価します。
SenseVoiceが扱う範囲
SenseVoice Smallは中国語、広東語、英語、日本語、韓国語の認識に加え、言語・感情・音声イベントを分類します。感情ラベルを人の本当の状態の証拠として使うべきではありません。
Whisperと公平に比較する
同じ音源、端末、精度設定を使い、読込時間、処理時間、メモリ、CER、固有名詞の誤りを記録します。初回のダウンロードやコンパイルは分けて測ります。
Apple Siliconで速度が変わる理由
CPU、GPU、統合メモリ、MLXなどの実装が性能を左右します。チップ、メモリ、モデル版、量子化、音声長を示さない倍率は再現できません。
SenseVoiceを先に試す場面
中日韓の大量音声やイベント検出には有力です。より広い言語や翻訳、既存のWhisper工程が必要ならWhisperを選び、言語自動判定には手動変更を用意します。
精度と速度以外の確認
ライセンス、端末内実行、モデル版、同期や分析を確認します。固定テスト音源で、重要語、無音時の幻覚、タイムスタンプ、メモリ、電池を更新ごとに比較します。
よくある質問
SenseVoice Smallの対応言語は?
公式モデルカードは中国語、広東語、英語、日本語、韓国語を中心に示しています。
必ずWhisperより高速ですか?
いいえ。ハードウェア、実装、量子化、音声長、比較するWhisperサイズで変わります。
感情ラベルを人事や医療判断に使えますか?
使うべきではありません。文脈と公平性に限界があり、専門家の判断を代替できません。