Voxtral 해설: 전사·오디오 Q&A·GPT-4o 비교
Mistral Voxtral 3B/24B, 32K 컨텍스트, 오디오 요약·질의응답, 로컬 배포와 공정한 평가법을 설명합니다.
업데이트

핵심 요약
- ASR과 음성 이해를 결합합니다.
- 3B와 24B가 Apache 2.0으로 공개됐습니다.
- 인식·추론·지연·비용·근거를 분리해 평가하세요.
기존 ASR과의 차이
Voxtral은 오디오에서 직접 질문, 요약과 함수 호출을 수행합니다. 오류 원인을 구분하기 어려워 중요한 작업은 전사나 시간 근거를 남겨야 합니다.
3B·24B·32K 컨텍스트
Mini는 약 3B, Small은 약 24B이며 공식 설명은 전사 약 30분, 이해 약 40분을 제시합니다. 로컬 성능은 양자화와 메모리에 달려 있습니다.
GPT-4o·Whisper와 공정하게 비교
전사는 WER/CER, 요약은 사실성, Q&A는 근거, 대화는 첫 응답 지연으로 나눠 비교하세요. 로컬과 API 비용도 구분합니다.
음성 이해가 필요한 경우
상담 분석, 인터뷰 연구와 회의 지식에 유용합니다. 단순 텍스트 변환은 일반 ASR이 더 단순하고 검증하기 쉽습니다.
배포 안전 점검
라이선스, 해시, 도구 권한, 입력 제한, 근거 저장과 오디오 프롬프트 공격을 점검하고 고위험 판단은 사람에게 넘기세요.
자주 묻는 질문
Voxtral은 오픈 소스인가요?
3B와 24B 가중치가 Apache 2.0으로 공개됐습니다.
완전 오프라인 실행이 가능한가요?
적절한 하드웨어에서는 가능하며 24B는 많은 자원이 필요합니다.
GPT-4o보다 좋은가요?
단일 답은 없습니다. 인식, 이해, 지연, 비용과 배포 통제를 비교하세요.