NVIDIA 음성모델, 사우디 방언 오류율 55%→30%
Nemotron 3.5 ASR 미세조정 결과…아랍어 지원과 지역 방언 성능은 별개 과제
현재 음성 인공지능 분야에서는 아랍어를 지원하는 모델도 지역 방언을 제대로 인식하지 못하는 문제가 부각되고 있다. 같은 언어 범주 안에서도 나지와 히자지처럼 지역별 말소리를 구분해 처리하는 성능이 핵심 과제로 떠올랐다.
현재 음성 인공지능 분야에서는 아랍어를 지원하는 모델도 지역 방언을 제대로 인식하지 못하는 문제가 부각되고 있다. 같은 언어 범주 안에서도 나지와 히자지처럼 지역별 말소리를 구분해 처리하는 성능이 핵심 과제로 떠올랐다.
NVIDIA는 Nemotron 3.5 자동 음성 인식 모델을 미세조정한 결과, 사우디아라비아의 나지·히자지 방언 단어 오류율이 55%에서 30%로 낮아졌다고 밝혔다. 확인된 수치는 두 방언을 대상으로 한 25%포인트 감소다.
이 결과의 의미는 아랍어 지원이라는 넓은 표기와 실제 지역 방언 인식 성능 사이에 간극이 있다는 데 있다. 모델이 특정 언어를 처리할 수 있다는 설명만으로는 지역 사용자의 말소리를 어느 수준까지 알아듣는지 판단하기 어렵다.
이번 수치가 보여주는 핵심 쟁점은 범용 언어 지원보다 방언별 적응 과정이 성능을 좌우할 수 있다는 점이다. 다만 이는 공개된 나지·히자지 방언의 단어 오류율 변화에 대한 분석이며, 다른 방언이나 다른 환경의 성능까지 입증한 결과는 아니다.
따라서 이번 개선은 두 사우디 방언에서 확인된 오류율 변화로 범위를 한정해 봐야 한다. 제품 전반의 정확도나 모든 아랍어권 이용자의 체감 성능으로 확대해 해석할 근거는 공개된 수치에 포함돼 있지 않다.