Voice AI 모델 선택, 이제 “사람처럼 들리는가”를 측정해야 합니다
Vapi의 Humanness Index 백서를 바탕으로, Voice AI 모델 평가에 Accuracy·Latency 외 Humanness와 Disclosure Fit이 필요한 이유를 롱폼으로 분석합니다.
보이스 AI 모델을 고를 때 대부분의 팀은 먼저 두 가지를 봅니다. 말을 정확히 읽는가, 그리고 얼마나 빨리 대답하는가. Vapi의 백서 *The Humanness Index™*는 여기에 세 번째 질문을 붙입니다. 고객이 듣기에 이 목소리가 사람처럼 느껴지는가?
이 질문은 단순한 취향 문제가 아닙니다. 실제 통화에서는 빠르고 정확한 음성도 상담원처럼 느껴지지 않으면 신뢰를 잃습니다. 고객은 WER이나 TTFB를 체감하지 않습니다. 대신 첫 문장의 호흡, 말끝의 온도, 끼어들기를 처리하는 타이밍, 잠깐의 침묵이 어색한지 여부로 “이 대화가 자연스러운가”를 판단합니다.
Vapi가 제기한 문제: 좋은 음성 모델의 3번째 축
백서는 음성 AI 모델의 품질을 세 축으로 나눕니다. 첫 번째는 Accuracy입니다. 입력 텍스트가 음성으로 얼마나 충실하게 구현되는지, 숫자나 이름이 틀리지 않는지, 문장이 누락되지 않는지를 보는 기준입니다. 두 번째는 Latency입니다. 사용자가 말을 마친 뒤 AI가 얼마나 빨리 반응하는지, 첫 음성이 나오기까지 시간이 얼마나 걸리는지를 봅니다.
세 번째가 Vapi가 강조하는 Humanness입니다. 음성이 자연스럽고 생생하며 실제 사람 말처럼 들리는 정도입니다. 기존 모델 선택에서는 이 세 번째 축이 가장 덜 측정됐지만, 고객-facing Voice AI에서는 오히려 가장 먼저 체감되는 품질일 수 있습니다.
Voice AI 모델 평가 3축
1. Accuracy = 말한 내용이 맞는가
2. Latency = 대화 리듬을 깨지 않을 만큼 빠른가
3. Humanness = 고객이 사람과 대화한다고 느끼는가
여기서 중요한 점은 세 축이 서로 대체되지 않는다는 것입니다. 정확도가 높아도 로봇처럼 들릴 수 있고, 빠르게 응답해도 감정 밀도가 어색할 수 있습니다. 반대로 아주 사람 같아도 지연시간이 길면 통화 흐름은 무너집니다. Vapi가 제안한 Humanness Index는 이 중 “사람 같음”을 독립된 평가 축으로 끌어올리려는 시도입니다.
기존 음성 벤치마크가 놓친 것
전통적인 TTS 평가는 MOS, 즉 Mean Opinion Score처럼 고립된 오디오 클립에 점수를 매기는 방식이 많았습니다. 이 방식은 음질 평가에는 쓸모가 있지만, 실제 대화형 Voice AI의 경험을 충분히 설명하지 못합니다. 통화는 정지된 샘플이 아니라 여러 턴으로 이어지는 상호작용이고, 고객은 음성만 듣는 것이 아니라 타이밍과 맥락까지 함께 듣습니다.
Vapi가 지적하는 한계는 크게 네 가지입니다.
- 클립이 짧고 고립되어 실제 대화 맥락이 없다.
- 평가가 끝날 때쯤 모델 버전이 이미 바뀌어 있을 수 있다.
- 서로 다른 source voice를 쓰면 모델 차이와 입력 샘플 차이가 섞인다.
- prosody, timing, tone을 각각 잘 측정해도 전체 인상은 설명되지 않을 수 있다.
이 마지막 지점이 특히 중요합니다. 사람은 목소리를 분석적으로 듣지 않습니다. 억양 20점, 호흡 30점, 감정 25점처럼 계산하지 않고, 몇 초 안에 “사람 같다” 또는 “AI 같다”를 판단합니다. 그래서 Vapi는 Humanness를 하위 요소의 합산 점수가 아니라 전체 인상에 대한 인간 판단으로 봅니다.
Humanness Index의 측정 방식
Humanness Index는 자동 점수를 만들기보다 사람에게 직접 묻습니다. 평가자는 두 개의 음성 샘플을 듣고 “Which voice sounds more human?”에 답합니다. 이 쌍대비교 결과를 모아 Bradley-Terry pairwise ranking model로 모델별 랭킹을 계산합니다.
백서가 설명한 통제 방식은 꽤 명확합니다. 실제 인간 음성 source clip을 가져오고, 각 provider의 voice cloning 기능으로 같은 클립을 재생성합니다. 그런 다음 같은 source voice, 같은 quote, 같은 audio filter를 유지한 상태에서 모델만 다르게 놓고 비교합니다.
평가 단위: 두 음성의 head-to-head 비교
질문: 어느 쪽이 더 사람처럼 들리는가?
통제 변수: same source voice / same quote / same audio filter
변수: TTS 또는 voice cloning model
집계: Bradley-Terry ranking → winning percentage