AI 스타트업 ElevenLabs, 음성 인식 시장에 도전
AI 스타트업 ElevenLabs가 첫 독립형 음성 인식 모델 'Scribe'를 공개했다. 기존에는 음성 생성 AI 기술로 주목받았던 ElevenLabs는 이번 출시를 통해 Gladia, Speechmatics, OpenAI의 Whisper 등과 경쟁하며 음성 인식 시장에 진입한다.
99개 언어 지원, 높은 정확도 제공
Scribe는 99개 이상의 언어를 지원하며, 이 중 25개 이상에서 높은 정확도를 구현했다고 밝혔다. 영어는 97%의 정확도를 기록했으며, 프랑스어, 독일어, 힌디어, 일본어 등도 포함된다. 정확도는 단어 오류율 기준으로 평가되며, 5% 미만이면 '우수', 510%는 '높음', 1020%는 '좋음', 25~50%는 '보통' 수준으로 분류된다.
구글·오픈AI 모델보다 우수한 성능
벤치마크 테스트 결과에 따르면, Scribe는 구글의 Gemini 2.0 Flash와 OpenAI의 Whisper Large V3보다 여러 언어에서 우수한 성능을 발휘하는 것으로 알려졌다. 이전까지 ElevenLabs의 음성 인식 기술은 AI 대화형 에이전트 플랫폼에 통합 형태로 제공됐지만, 이번 제품은 단독형 음성 인식 모델로 개발됐다.
향후 실시간 음성 인식 기능 추가 예정
Mati Staniszewski CEO는 "음성 인식 기술을 지속적으로 발전시키고 있으며, 정확한 음성 전사 및 이해도를 높이기 위해 노력하고 있다"고 설명했다. Scribe는 화자 구별 기능, 자막용 단어 단위 타임스탬핑, 관객 웃음 등의 자동 태깅 기능을 갖추고 있다. 현재는 사전 녹음된 음성만 처리할 수 있지만, 향후 실시간 음성 인식 기능도 추가될 예정이다.
이용 요금, 시간당 0.40달러 책정
Scribe의 서비스 이용 요금은 음성 전사 1시간당 0.40달러로 설정됐다. 이는 경쟁사 제품과 비교해 합리적인 가격으로 평가되며, 음성 인식 솔루션을 찾는 기업들에게 매력적인 선택지가 될 것으로 보인다.
의견
ElevenLabs의 이번 Scribe 출시로 음성 인식 시장이 더욱 활발해질 것으로 보인다. 특히 다양한 언어를 지원하는 점과 높은 정확도를 강조하는 전략이 경쟁사 대비 우위를 점하는 핵심 요소가 될 수 있다. 향후 실시간 음성 인식 기능이 추가되면 더욱 강력한 솔루션이 될 것으로 기대된다.