Whisper 전사 완벽 가이드: 모델, 정확도와 오프라인 실행
Whisper의 원리, tiny부터 large-v3-turbo까지의 선택, 다국어 평가와 Mac·iPhone 로컬 실행을 정리합니다.
업데이트

핵심 요약
- 큰 모델이 항상 최선은 아닙니다.
- 실제 녹음으로 속도·메모리·핵심 오류를 측정하세요.
- WER 외에 환각과 중요한 개체 오류도 확인하세요.
Whisper가 음성을 텍스트로 바꾸는 방식
Whisper는 스펙트로그램을 인코딩하고 다국어 텍스트를 디코딩합니다. 음악, 겹말, 고유명사, 긴 침묵에서는 오류나 환각이 생길 수 있습니다.
tiny부터 turbo까지 선택
tiny·base는 경량, small은 균형, medium·large는 어려운 음성, turbo는 빠른 로컬 처리에 적합합니다. 런타임과 양자화도 성능을 바꿉니다.
- 짧은 메모는 소형 또는 turbo
- 다국어는 small 이상 비교
- 구형 기기는 메모리 우선
- 중요 기록은 사람 검토
목적에 맞는 정확도 평가
WER/CER와 함께 이름, 숫자, 부정, 원거리 음성, 언어 혼용을 평가하세요. 의미를 뒤집는 오류는 조사 하나가 빠지는 것보다 중요합니다.
완전 오프라인 실행
모델을 먼저 저장한 뒤 네트워크를 끄고 새 녹음을 처리해 확인합니다. 동기화와 분석 기능은 별도로 점검하세요.
다른 로컬 모델과 역할 분담
Whisper는 넓은 언어, Parakeet은 지원 유럽 언어 속도, SenseVoice는 한중일, Voxtral은 음성 이해에 강점이 있습니다.
자주 묻는 질문
Whisper는 완전 오프라인으로 작동하나요?
모델 저장 후 로컬 추론이 가능합니다. 동기화와 분석은 별도 확인이 필요합니다.
다국어에 어떤 모델이 좋나요?
small이나 turbo부터 시작해 실제 음성으로 medium·large와 비교하세요.
가장 큰 모델이 항상 정확한가요?
아닙니다. 언어, 음질, 양자화와 설정에 따라 다릅니다.
법률·의료 기록에 바로 쓸 수 있나요?
안 됩니다. 전문가가 원음과 대조하고 관련 규정을 따라야 합니다.