Gemini 3.8 Live와 Extended Thinking, 무엇이 다를까? 벤치마크부터 상담 실험까지
실시간 음성 모델의 차이와 벤치마크를 풀어보고, 같은 한국어 결항 상담을 맡겨 답변·처리 시간·비용을 비교했습니다.
TALK LAB · BringTalk | 실험 2026년 9월 17일 · 글 업데이트 2026년 9월 18일
Google이 실시간 음성 모델 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 공개했습니다. Google 발표에서 Extended Thinking은 음성 모델 종합 평가 1위에 올랐습니다. 그렇다면 전화 상담을 맡길 때도 더 좋은 선택일까요?
이 질문에 답하려면 먼저 두 모델의 차이와 높은 점수가 어떤 능력을 가리키는지 알아야 합니다. 이를 짚은 뒤 TALK LAB이 실제로 실행한 한국어 결항 상담 실험을 살펴보겠습니다. 같은 고객 요청에 무엇이라고 답했고, 어떤 업무를 처리했으며, 얼마가 들었는지 비교했습니다.
Gemini 3.8 Live는 Google의 실시간 음성 대화 모델입니다
OpenAI의 GPT Realtime을 알고 있다면 같은 종류의 제품으로 이해하면 됩니다. 사용자의 목소리를 듣고 음성으로 답하며, 연결된 기능을 이용해 조회나 예약 같은 일을 처리하는 모델입니다. 다만 모델만으로 전화 상담 서비스가 완성되지는 않습니다. 실제로 전화를 받고 예약을 바꾸려면 통화 시스템과 예약 시스템을 연결해야 합니다. Google 모델 설명 · OpenAI의 gpt-realtime 소개
예를 들어 고객이 “내일 예약을 바꿔주세요”라고 말하면, AI가 날짜를 되묻고 빈자리를 조회한 뒤 가능한 시간을 음성으로 제안합니다. 3.8 Live는 조회를 진행하는 동안에도 고객에게 음성으로 안내하며 대화를 이어갈 수 있습니다. 화면이나 카메라 입력을 함께 받아 상황을 이해하는 기능도 지원합니다. Google 개발자 발표
GPT Realtime에도 외부 기능을 실행하면서 대화를 이어가는 기능이 있으므로, 이런 실시간 대화와 업무 실행이 Google만의 발명은 아닙니다. 이번 글에서 살펴볼 것은 복잡한 요청에서도 대화를 이어가며 판단을 얼마나 잘하느냐입니다.
Extended Thinking은 켜고 끄는 부가기능일까?
개발자가 사용하는 API(프로그램에서 모델을 연결하는 통로)에서는 별도로 선택하는 모델입니다. 일반 Live를 선택한 뒤 ‘Extended 켜기’ 버튼만 누르면 되는 구조는 아닙니다.
- Gemini 3.8 Live: 빠른 대화와 많은 요청의 효율적인 처리를 목표로 한 기본 모델입니다. 자체적으로 판단을 수행하지만, 개발자가 생각하는 강도를 지정하는 설정은 없습니다.
- Gemini 3.8 Live Extended Thinking: 여러 단계의 판단이 필요한 업무에 맞춘 모델입니다. 이 모델을 선택한 뒤 생각하는 강도를 LOW·MEDIUM·HIGH, 즉 낮음·중간·높음으로 설정합니다. 이번 실험은 HIGH를 사용했습니다.
상담원에 비유하면, Extended는 고객에게 “확인해 볼게요”라고 응답하는 동안에도 뒤에서 규정과 대안을 계속 검토하도록 설계된 쪽입니다. 일반형을 ‘생각하지 않는 모델’로 보면 안 됩니다. 두 모델은 빠른 대화와 복잡한 판단에 두는 비중이 다릅니다. 일반 Live 설정 · Extended 설정
비용도 구분해야 합니다. 두 모델의 사용량 단가는 같습니다. Extended에 별도 부가요금을 붙이는 방식이 아니라, 생각하고 말하는 데 사용한 양이 많아지면 총비용이 늘어납니다. 같은 요금제로 통화해도 사용량에 따라 청구액이 달라지는 것과 비슷합니다. 복잡한 일을 더 해결할 가능성은 있지만, 그만큼 시간이 더 걸리거나 총사용료가 늘어나는지도 함께 확인해야 합니다. 공식 요금표
벤치마크가 좋다는데, 무슨 일을 더 잘했다는 뜻일까?
벤치마크는 여러 모델에 같은 시험을 치르게 하는 성능 평가입니다. 운전면허 필기 점수와 실제 도로주행 평가가 다르듯, 음성 모델도 무엇을 시험했는지에 따라 숫자의 뜻이 달라집니다.
Google은 9월 15일 발표에서 Extended Thinking의 음성 종합지수 82.6점·1위, Big Bench Audio 97.7%, **τ-Voice 68.6%**를 소개했습니다. 첫 번째는 여러 평가를 합친 점수이고, 두 번째는 음성으로 들려준 추론 문제의 정답률입니다. 따라서 97.7%를 ‘한국어를 97.7% 정확히 받아썼다’거나 ‘상담을 97.7% 해결했다’는 뜻으로 읽어서는 안 됩니다. Google 발표 · 평가 방법
전화 상담을 얼마나 잘 처리하는지 알아보려는 우리 관심사에는 **τ-Voice(타우 보이스)**가 더 가깝습니다. 상담 규정과 업무 기능을 제공하고, 모의 고객의 요청을 받은 모델이 실제로 업무를 올바르게 처리했는지 확인합니다. 예를 들어 예약을 바꾸겠다고 말하는 데 그치지 않고, 실제 시험용 예약 기록이 정답대로 바뀌어야 합니다.
2026년 9월 18일 Artificial Analysis의 같은 평가표에서 확인한 결과는 다음과 같습니다.
- Gemini 3.1 Flash Live High: 37.7%
- Gemini 3.8 Live: 30.1%
- Gemini 3.8 Live Extended Thinking High: 68.6%
- OpenAI GPT-Live-1 Astra, medium 설정: 67.9%
Extended는 이 시험에서 일반 3.8 Live보다 38.5%포인트, 이전 3.1 High보다 30.9%포인트 높았습니다. 복잡한 모의 상담을 더 많이 해결했으므로, 실제 업무에서도 시험해 볼 이유가 있습니다. 다만 비교한 OpenAI 모델과의 차이는 0.7%포인트에 그칩니다. 시험을 반복한 횟수도 같지 않으므로, 이 숫자만으로 확실한 우위를 단정할 수는 없습니다. 평가기관 원표와 실행 조건
모든 항목에서 Extended가 앞선 것도 아닙니다. 끼어들기나 말차례 같은 대화 흐름 평가에서는 일반 3.8 Live가 96.1%, Extended가 **91.9%**였습니다. 더 어려운 업무를 푸는 능력과 대화를 매끄럽게 주고받는 능력을 따로 봐야 하는 이유입니다. 같은 평가표
높은 점수가 우리 상담에서도 값어치를 할까?
공개 평가 결과를 보면 Extended가 더 복잡한 상담을 해결하리라는 기대를 할 수 있습니다. 하지만 우리가 맡길 업무에도 그만큼의 판단 능력이 필요한지는 따로 확인해야 합니다. 한국어 고객이 주는 조건, 회사 규정, 연결된 예약 기능이 달라지면 결과도 달라질 수 있습니다.
그래서 TALK LAB은 두 모델에 같은 한국어 결항 상담을 맡겼습니다. Extended가 일반 Live보다 더 많은 문제를 해결하고, 그 이득이 추가 시간과 비용을 감당할 만큼 큰지 확인한 작은 실험입니다. 공개 벤치마크를 재현하거나 반박하는 시험은 아닙니다. 이제 고객의 문제와 정답부터 살펴보겠습니다.
비행기가 취소됐습니다. 내일 아침 중요한 회의가 있는 고객이 여행사에 전화합니다.
“내일 오전 9시까지 두 명 모두 회의 장소에 도착해야 해요. 같은 편으로 이동하고, 추가 비용은 둘 합쳐 10만 원까지예요.”
상담원에게는 세 가지 대안이 있습니다. 가장 일찍 도착하는 항공편은 예산을 넘고, 가장 싼 항공편은 회의에 늦습니다. 열차와 숙박을 묶어도 예산이 부족합니다. 그런데 결항 사유에 따라 항공 요금을 깎아줄 수 있다면 답이 달라집니다.
이 상담의 정답은 ‘감면을 적용한 A편’입니다
여행 상담원이 메모지에 도착 시각과 가격을 적어 후보를 지우는 장면을 떠올려 보세요. 아래 그림에서는 시간과 예산을 모두 지키는 안만 남기면 됩니다. 모든 시각은 공항이 아닌 회의 장소 도착 시각, 모든 금액은 두 사람 합계입니다.

실험을 위해 만든 가상 여정과 규정입니다. 실제 항공사의 보상 정책이 아닙니다. 그림 크게 보기.
A편의 원래 비용은 항공 추가금 12만 원과 지상 이동비 2만 원, 합계 14만 원입니다. 이번에는 항공사 운영 사유로 취소됐고, A편은 감면 요건을 충족합니다. 두 명의 항공 추가금에서 총 10만 원을 감면하면 고객이 낼 돈은 4만 원입니다. 회의 장소에도 08:15에 도착하니 조건에 맞습니다.
B편은 2만 원이지만 09:10에 도착하므로 탈락입니다. C편은 전날 심야 열차와 숙박을 묶어 08:30에 도착하지만, 총 11만 5천 원이라 예산을 넘습니다. 따라서 상담원은 감면을 적용한 A편을 제안하고, 고객이 동의하면 예약해야 합니다.
이 상담에서 어려운 일은 규정을 확인해 고객 조건에 맞는 방법을 찾는 것입니다. 감면 전 가격만 보면 세 후보 모두 조건에 맞지 않지만, 규정을 적용하면 A편을 예약할 수 있습니다. 이런 검토까지 AI가 처리하면 사람이 이어받아 다시 검토하는 일을 줄일 수 있습니다.
두 모델은 같은 정답에 어떻게 도착했을까?
이번 실험에서 Extended는 높은 추론 강도인 HIGH로 설정했습니다.
두 모델에는 같은 고객 음성, 같은 규정, 같은 후보를 줬습니다. 예약 조회·계산·확정 기능도 동일하게 연결했습니다. 한국어 합성 음성으로 실제 모델을 호출했지만, 예약 대상은 가상 시스템입니다.
앞의 A편 문제에서 두 모델은 어떻게 답했을까요? 아래는 모델이 말한 내용을 글로 기록한 전사문으로, 고객 승인을 받기 전 실제 출력 전사문을 나란히 놓았습니다. Extended는 긴 설명 가운데 핵심 부분을 발췌했습니다. 휴대폰에서는 표를 좌우로 밀어 비교할 수 있습니다.
| Gemini 3.8 Live | Extended Thinking HIGH |
|---|---|
| 실제 출력 전사문 · 전체 첫 답변 | 실제 출력 전사문 · 일부 발췌 |
| “가장 먼저 도착하는 A 여정 안내해 드립니다. 오전 8시 15분에 도착하고, 감면 적용되어 두 분 합쳐 총 추가 비용은 4만 원입니다. 이 안으로 진행할까요?” | “예약 상황과 대체 편을 확인해 볼게요.” [중간 생략] “항공사 운영 사유 결항으로 확인되어 동일 운항사 대체편 규정에 따라 두 분 총 10만 원의 감면 혜택이 적용됩니다.” [중간 생략] “비용 내역은 항공 추가금 12만 원에서 10만 원 감면 적용 후 지상 이동비 2만 원을 포함하여 두 명 총 추가 비용은 4만 원입니다.” [중간 생략] “후보 A로 예약을 확정 진행해 드릴까요?” |
| A편 · 두 명 총4만 원 예약 · 23.9초 후 시스템에 저장 · 관측 비용 48~58원 | A편 · 두 명 총4만 원 예약 · 69.8초 후 시스템에 저장 · 관측 비용 177~181원 |
| 전체 대화 원문 · 모델 음성 듣기 | 전체 대화 원문 · 모델 음성 듣기 |
Live는 곧바로 A편의 도착 시각과 최종 금액을 말하고 승인을 구했습니다. Extended는 먼저 확인 중이라고 알린 다음, 감면이 가능한 이유와 최종 금액 4만 원의 계산 과정을 설명했습니다. 짧게 결론을 주는 답변과 계산 근거까지 풀어주는 답변의 차이가 보입니다.
고객이 동의하자 두 모델 모두 A편을 4만 원에 예약했습니다. 첫 고객 발화가 끝난 뒤 예약이 시스템에 저장되기까지 Live는 23.9초, Extended는 69.8초가 걸렸습니다. 이 한 회차의 관측 모델 비용은 각각 약 48~58원, 약 177~181원입니다. 금액은 저장된 사용량을 유료 정가로 계산한 뒤, 1달러=1,400원으로 환산했습니다.
Extended는 더 상세히 설명했지만, 선택한 여정과 최종 가격은 Live와 같았습니다. 상세한 안내가 고객의 신뢰를 높일 수는 있습니다. 하지만 이번 시험에서는 실제 고객에게 만족도를 묻지 않았으므로, 상세한 설명이 추가 대기 시간과 비용을 감수할 만큼 도움이 됐는지는 판단할 근거가 아직 없습니다.
날씨 때문에 취소됐다면, 예약하지 않는 것이 정답입니다
이번에는 다른 조건을 그대로 두고 결항 사유만 기상 악화로 바꿨습니다. 가상 규정상 기상 결항에는 감면이 없습니다. 감면을 받지 못하면 A편은 다시 14만 원이 됩니다. 이제 세 후보 중 시간과 예산을 모두 만족하는 안은 없습니다.
이때 상담원이 할 일은 고객에게 예산이나 도착 시간을 바꿀 수 있는지 묻는 것입니다. 고객은 “예산도 도착 시간도 바꿀 수 없고, 따로 이동할 수도 없다”고 답하도록 했습니다. 정답은 조건을 어긴 예약을 만들지 않고, 검토한 내용을 담당자에게 넘기는 것입니다.
같은 질문을 받은 두 모델의 실제 답변을 다시 보겠습니다. 아래 Extended 답변은 후보별 설명 뒤에 나온 결론을 발췌했습니다.
| Gemini 3.8 Live | Extended Thinking HIGH |
|---|---|
| 실제 출력 전사문 · 전체 첫 답변 | 실제 출력 전사문 · 일부 발췌 |
| “예산과 도착 조건(오전 9시)을 모두 만족하는 대안이 없습니다. 예산 또는 도착 시간 조건을 완화할 수 있으신가요?” | “현재 두 분 합산 10만 원 예산과 오전 9시 도착 조건을 모두 만족하는 여정이 없습니다. 예산을 상향하시거나 도착 시간 제한을 조정해주실 수 있으신가요?” |
| 조건 변경 거절 후 담당자 이관 · 22.0초 후 시스템에 저장 · 관측 비용 39~48원 | 조건 변경 거절 후 담당자 이관 · 95.8초 후 시스템에 저장 · 관측 비용 282~287원 |
| 전체 대화 원문 · 모델 음성 듣기 | 전체 대화 원문 · 모델 음성 듣기 |
두 모델 모두 조건을 바꿀 수 있는지 물었고, 고객이 거절하자 담당자에게 넘겼습니다. Live는 불가능한 이유를 짧게 요약했습니다. Extended는 세 후보의 비용과 도착 시각을 하나씩 설명한 뒤 같은 결론을 냈습니다. 담당자에게 넘긴 기록이 저장되기까지는 각각 22.0초, 95.8초였습니다.
이 사례에서는 예약 건수를 늘리는 것이 좋은 성과가 아닙니다. 잘못 예약하면 예산 초과나 회의 지각이라는 문제가 생깁니다. 두 모델 모두 조건에 맞지 않는 예약은 하지 않았습니다. 다만 담당자에게 넘겼으므로 사람이 이어받아야 하는 상담은 그대로 남았습니다.
설명은 달랐지만, 해결한 업무 수는 같았습니다
이 두 사례 외에 예산을 12만 원으로 높인 상황과 도착 마감을 09:30으로 늦춘 상황도 비교했습니다. 기상 결항에서도 예산이 늘면 C를 선택할 수 있고, 도착 마감이 늦어지면 B를 선택할 수 있습니다. 두 모델은 이 경우에도 각각 맞는 안을 예약했습니다.
TALK LAB이 2026년 9월 17일 실행한 한국어 가상 상담 중 비교 가능한 4개 상황·8회에서는 두 모델 모두 예약 3건, 적절한 담당자 이관 1건으로 결과가 같았습니다. 실제로는 6개 상황·12회를 실행했으나, 가상 고객의 응답 오류가 확인된 2개 상황은 양쪽 모델 모두 비교에서 제외했습니다. 상황마다 한 번씩 실행한 작은 표본이므로 일반적인 모델 성공률로 읽어서는 안 됩니다.
아래는 앞서 살펴본 두 사례를 포함해, 비교 가능한 네 상황을 모두 묶은 결과입니다. ‘첫 음성’은 상담원이 “확인해 볼게요”라고 말하기 시작할 때까지, ‘업무 처리’는 실제 예약이나 담당자 전달이 시스템에 저장되기까지라고 보면 됩니다.
| 비교한 항목 | Gemini 3.8 Live | Extended Thinking HIGH |
|---|---|---|
| 업무 결과 | 예약 3건 · 이관 1건 | 예약 3건 · 이관 1건 |
| 첫 음성이 나오기까지 | 5.0초 | 1.4초 |
| 예약·이관이 실행되기까지 | 23.7초 | 97.2초 |
| 상담 한 건당 관측 모델 비용 | 약 44~53원 | 약 248~253원 |
시간은 첫 고객 발화가 끝난 때부터의 중앙값, 비용은 모델별 네 회차의 평균입니다. 첫 음성은 음성 데이터가 도착한 시점으로, 실제 스피커 재생 지연은 측정하지 않았습니다. 1달러=1,400원 환산 가정이며 실제 결제액은 아닙니다.
Extended는 첫 안내를 더 빨리 시작했지만, 업무 처리는 더 늦게 끝났습니다. 첫 안내가 빨라도 실제 예약이나 담당자 전달까지의 대기는 길 수 있다는 얘기입니다. 이번 시험에서는 긴 설명과 내부 판단이 각각 전체 비용에 얼마나 영향을 줬는지 따로 측정하지 않았으므로, 비용 차이 전부를 ‘더 깊이 생각한 비용’이라고 단정할 수는 없습니다.
건당 약 200원을 더 쓸 이유가 있었을까?
두 모델의 공식 사용량 단가는 같습니다. 같은 요금제로 통화해도 오래 쓰면 돈이 더 드는 것처럼, 이번 시험에서는 처리한 사용량이 달라 비용 차이가 생겼습니다. 관측한 차이는 상담 한 건당 약 195~209원입니다.
금액만 보면 작습니다. 하지만 모든 상담에 Extended를 쓰면, 일반 Live로도 해결할 수 있는 상담에도 이 비용을 더 냅니다. 추가 비용을 낼 이유가 있으려면, 사람이 이어받아야 했던 업무를 더 해결하거나 고객이 상담에서 얻는 이득이 그만큼 커야 합니다.
사람이 이어받는 상담 한 건의 처리비를 5,000원이라고 가정해 보겠습니다. 상담 100건에 약 200원씩 더 쓰면 추가 지출은 약 2만 원입니다. 사람에게 넘길 일을 약 4건 줄이면 그 비용을 회수할 수 있습니다.

5,000원은 설명용 가정입니다. 실제 관측 비용 차이로 계산하면 100건당 약 3.9~4.2건을 더 해결해야 합니다. 통신비, 대기 시간의 손실, 잘못된 예약을 복구하는 비용은 포함하지 않았습니다.
이번 비교에서 Extended가 추가로 해결한 업무는 없었습니다. 따라서 이 네 상황에서는 추가 사용료를 낼 만큼 사람의 후속 처리가 줄었다는 근거를 찾지 못했습니다. 이 판단은 이번에 비교한 네 상황에 한정됩니다. Extended가 모든 업무에서 불필요하다고 볼 수는 없습니다.
다음에는 ‘일반 Live가 못 푼 상담’을 시험해야 합니다
이번 결과만 놓고 보면, 후보 세 개와 정해진 감면 규정이 있는 이 업무는 일반 Live부터 검토할 만합니다. 같은 예약·이관 결과를 더 적은 관측 비용과 짧은 시간에 얻었기 때문입니다. 다만 실제 도입 여부는 더 많은 상담과 사람의 통화로 확인해야 합니다.
Extended에 추가 비용을 낼 가치가 있는지 더 알아보려면 일반 Live가 실패하는 상담을 시험해야 합니다. 여러 예약을 함께 바꿔야 하거나, 고객이 도중에 조건을 수정하거나, 조회 결과가 서로 충돌하는 상담이 그 후보입니다. 이런 상황을 시험할 때는 문제를 복잡하게 만드는 데 그치지 않고, 실제 현장에서 어떤 이유로 사람이 상담을 이어받았는지도 반영해야 합니다.
다른 업무에서도 같은 방식으로 시작할 수 있습니다. 담당자가 실제로 고민했던 상담 하나를 고르고, 고객 조건과 정답을 먼저 적습니다. 두 모델에 같은 자료와 기능을 준 뒤 무엇을 말했는지, 실제로 무엇을 처리했는지, 사람의 일이 얼마나 남았는지를 비교합니다. ServiceNow의 공개 음성 평가 프로젝트 EVA는 이런 시험의 시나리오와 평가 구조를 참고할 수 있는 자료입니다. 이번 실험은 EVA의 공식 평가를 수행한 것은 아닙니다.
더 깊이 생각하는 모델에 비용을 더 낼지는 고객의 문제를 얼마나 더 해결했는지로 판단해야 합니다. 이번에는 설명이 더 상세해졌어도 추가로 해결한 업무는 없었습니다. 다음 시험에서는 일반 Live가 해결하지 못한 상담을 Extended가 처리해 사람의 후속 업무를 줄이는지 확인해야 합니다.
실험 조건과 원자료
고객은 macOS Yuna 합성 음성, 모델 출력 음성은 Kore를 사용했습니다. 실제 전화망·주변 소음·사람의 끼어들기는 시험하지 않았습니다. 저장된 전사문과 도구 기록을 검토했으며, 사람의 청취 평가는 수행하지 않았습니다.
좌석 부족·모호한 예산 두 상황은 가상 고객의 응답 문제로 비교에서 제외했습니다. 예약 후 불필요한 추가 대화가 생긴 회차는 모든 회차에 동일하게 ‘첫 업무 완료 뒤 첫 모델 종료 신호까지’를 적용해 비교했습니다. Extended의 유효 네 회차 중 두 회차는 올바른 결과를 저장한 뒤에도 모델 종료를 확인하지 못해 150초 제한으로 끝났습니다. 제외·추가 대화 비용은 전체 실험 지출에 남겼습니다.
기록된 사용량 일부는 어느 요금 항목에 해당하는지 불명확해 비용을 범위로 표시했습니다. 미수신 사용량, 별도 전사 비용, 세금과 크레딧 적용은 최종 청구서와 대조하지 않았습니다. 초기 원고의 달러당 2,000원 환산은 예산 관리용 가정을 잘못 가져온 것으로, 본문·이미지·계산기를 모두 달러당 1,400원 기준으로 바로잡았습니다. 이는 실시간 환율을 측정한 값이 아니라 비교를 위한 가정입니다.
실험 자료 내려받기: 음성·전체 대화·회차별 결과, 약 30 MB · 자료 읽는 법과 비용 계산식 · 비교 발언 원문 · 집계 자료 · 실행 조건
음성 파일은 수신한 모델의 음성 조각을 이어 붙인 청취용 자료입니다. 무음과 대기 시간을 보존한 실제 통화 녹음이 아니므로, 파일 길이를 상담 처리 시간으로 읽으면 안 됩니다.
