본문 바로가기
성공지식백과 로고성공지식백과

구글 Gemini 3.8 Live 공개, Extended Thinking은 말하면서 동시에 생각한다

Google이 실시간 음성 대화 모델 Gemini 3.8 Live와 3.8 Live Extended Thinking을 공개했습니다. 말하는 동안 뒤에서 추론하고 도구를 실행하는 방식과 API 모델 ID, 가격, Gemini Live·Search Live 제공 범위를 공식 자료로 정리했습니다.

GeminiGemini APIAI 에이전트AI 모델음성 AI
정성준 12분 읽기
공유:
연한 파란 배경에 Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking 문구와 Gemini 로고, 말풍선 그래픽이 있는 Google 발표 배너
Google의 Gemini 3.8 Live·3.8 Live Extended Thinking 공식 발표 배너. · Google

Google은 9월 15일 실시간 음성 대화 모델 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 공개했습니다. 한국 시간으로는 9월 16일 새벽입니다. 두 모델은 사용자의 음성을 듣고 음성으로 답하는 오디오 대 오디오 모델입니다. Google은 3.8 Live를 대규모 서비스와 비용 효율에 맞춘 모델로 소개했습니다. 3.8 Live Extended Thinking은 복잡한 다단계 작업을 위해 만들었다고 밝혔습니다.

말하면서 동시에 생각한다는 설명은 두 모델 가운데 Extended Thinking에 해당합니다. Google은 이 모델이 추론과 발화를 동시에 한다고 밝혔습니다. 답을 따져 보거나 도구 결과를 기다리는 동안 말을 멈추지 않고 "Let me check that…" 같은 짧은 말로 요청을 받았다고 알린 뒤 진행 중인 작업을 실시간으로 설명하는 방식입니다. 이 모델로 음성 에이전트를 만드는 개발자는 모델이 말을 마친 시점과 작업을 마친 시점을 따로 처리해야 합니다.

말하는 동안 뒤에서 추론하는 Extended Thinking

Gemini API의 Thinking 가이드는 기존 음성 모델의 한계부터 설명합니다. 일반 음성 모델은 말을 들으면 곧바로 답하기 때문에 빠르게 주고받는 대화에 잘 맞습니다. 하지만 계획이나 복잡한 분석, 외부 도구가 필요한 요청에서는 추론 없이 답하거나 도구가 끝날 때까지 말없이 기다려야 한다고 문서는 적었습니다.

Extended Thinking은 여기에 백그라운드 추론을 더했습니다. 모델은 뒤에서 계획을 세우고 비동기 도구를 호출하는 동안 대화가 끊기지 않도록 짧은 발화를 이어갑니다. 문서가 드는 예시는 항공편을 조회하는 중이라고 알리는 "Checking flight options now" 같은 문장입니다. Google이 발표문에 올린 시연 영상에서는 이 모델이 간단한 스케치와 음성 피드백을 받아 React 컴포넌트를 만들고 여러 단계의 예약을 대화를 끊지 않고 처리합니다.

추론의 깊이는 개발자가 정합니다. Extended Thinking은 세션 설정의 thinking_levellow, medium, high 중에서 고를 수 있고 minimal은 지원하지 않습니다. 함수 도구는 behavior: NON_BLOCKING으로 선언한 비동기 함수만 쓸 수 있으며 동기식 BLOCKING 함수를 선언하면 오류가 반환됩니다. 비동기 함수의 결과를 받은 모델이 곧바로 알릴지, 하던 일을 마친 뒤 알릴지, 조용히 반영할지 정하는 function scheduling 설정도 이 모델에서는 지원하지 않습니다. 문서의 Python 예시는 두 설정을 다음처럼 함께 넣습니다.

live_thinking_config.py복사
search_flights = types.FunctionDeclaration(
    name="search_flights",
    description="Searches for available flights.",
    behavior="NON_BLOCKING",
    parameters={
        "type": "OBJECT",
        "properties": {
            "destination": {"type": "STRING"},
        },
        "required": ["destination"],
    },
)

config = types.LiveConnectConfig(
    response_modalities=["AUDIO"],
    thinking_config=types.ThinkingConfig(
        thinking_level="low",
    ),
    tools=[types.Tool(function_declarations=[search_flights])],
)
전체 보기

턴이 끝났다는 신호와 작업이 끝났다는 신호가 갈라졌다

Extended Thinking을 쓰려면 클라이언트가 세션 상태를 읽는 방식부터 바꿔야 합니다. 3.8 Live에서는 서버가 turnComplete: true를 보내면 모델이 턴을 마치고 대기 상태로 돌아갑니다. Extended Thinking에서는 이 신호가 한 번의 발화가 끝났다는 뜻에 그치며 서버는 그 뒤에도 추론이나 도구 호출을 계속할 수 있습니다.

그래서 Google 문서는 서버 메시지의 interaction_status 필드를 보라고 안내합니다. 값이 IN_PROGRESS이면 서버가 입력을 처리하거나 백그라운드 추론을 하거나 비동기 도구의 응답을 기다리는 중입니다. IDLE이 오면 추론과 도구 호출이 모두 끝나고 사용자 입력을 기다리는 상태입니다. 문서의 예제도 IDLE을 받았을 때만 화면을 듣기 상태로 바꾸고 IN_PROGRESS에서는 생각 중 상태로 둡니다.

문서가 보여 주는 응답 순서는 네 단계입니다. 서버가 먼저 짧은 발화를 IN_PROGRESS 상태로 보내고 이어서 도구 호출을 보냅니다. 클라이언트가 함수를 실행해 결과를 돌려주면 모델이 최종 답을 말하고 서버 상태가 IDLE로 바뀝니다. 음성 앱의 마이크 표시나 로딩 표시를 turnComplete만으로 제어해 왔다면 이 흐름에 맞춰 상태 처리 코드를 다시 확인해야 합니다.

3.8 Live는 추론 설정 없이 빠른 대화를 맡는다

모델 문서는 3.8 Live를 대부분의 저지연 음성 에이전트와 추론으로 인한 지연 없는 실시간 대화에 쓰는 기본 선택지로 안내합니다. 추론 방식은 interleaved reasoning으로 적혀 있고 문서는 thinking_level을 지원하지 않으니 세션 설정에서 빼라고 안내합니다.

Google 발표문에 따르면 3.8 Live는 시각 입력을 거의 실시간으로 처리하고 대화 중에 97개 언어를 자동으로 감지해 전환합니다. 도구와 API 호출을 백그라운드에서 실행하면서 대화를 이어가는 기능도 있습니다. 문서에도 비동기 함수 호출이 기본값으로 적혀 있고 기존 코드와의 호환을 위해 BLOCKING 방식도 계속 쓸 수 있습니다. 기존 Gemini 3.1 Flash Live Preview는 함수 호출을 순차 방식으로만 처리해 도구 응답을 보내기 전까지 모델이 답을 시작하지 않습니다.

Thinking 가이드는 두 모델의 쓰임새도 나눠 설명합니다. 3.8 Live는 고객 상담 분류, 언어 연습, 음성 검색처럼 주고받는 속도가 중요한 대화와 밀리초 안에 결과가 돌아오는 도구에 권장됩니다. Extended Thinking은 여러 로그와 오류 코드를 살펴야 하는 기술 지원, 항공편과 호텔을 병렬로 조회하는 예약, 공식이나 코드를 검증해야 하는 튜터링, 몇 초씩 걸리는 함수 때문에 침묵이 생기는 음성 서비스에 권장됩니다.

항목Gemini 3.8 LiveGemini 3.8 Live Extended Thinking
모델 IDgemini-3.8-livegemini-3.8-live-extended-thinking
권장 용도저지연 음성 에이전트, 직접적인 명령, 빠른 도구다단계 문제 해결, 복잡한 계획, 여러 도구를 쓰는 작업
추론 설정thinking_level 미지원low·medium·high (minimal 미지원)
대기 상태 판단turnCompleteinteraction_status
함수 호출BLOCKING·NON_BLOCKING 모두 지원NON_BLOCKING만 지원
입력·출력 토큰 한도131,072 / 65,536131,072 / 65,536

가격은 3.1 Flash Live Preview와 같은 항목으로 묶였다

Gemini API 가격표에서 두 모델은 기존 Gemini 3.1 Flash Live Preview와 같은 요금 항목에 묶여 있습니다. 유료 등급의 100만 토큰당 입력 가격은 텍스트 0.75달러, 오디오 3.00달러, 이미지·동영상 1.00달러입니다. 출력 가격은 텍스트 4.50달러와 오디오 12.00달러이며 추론 토큰이 출력 가격에 포함됩니다. 무료 등급은 요금이 없지만 가격표는 무료 등급 데이터가 Google 제품 개선에 사용되고 유료 등급 데이터는 사용되지 않는다고 표시합니다.

Google 개발자 블로그가 제시한 가격은 분당 오디오 입력 0.005달러와 오디오 출력 0.018달러입니다. 블로그는 이 금액이 100만 토큰당 입력 3달러와 출력 12달러를 기준으로 한 추정치라고 각주에 적었습니다. 분당 금액이 추정치인 만큼 실제 비용은 토큰 사용량으로 확인해야 합니다. 출력에 추론 토큰이 포함되기 때문에 Extended Thinking의 추론 수준을 높인 세션은 같은 통화 시간이라도 토큰 사용량이 달라질 수 있습니다.

지원 기능 표를 보면 함수 호출 방식과 추론 설정을 빼고는 두 모델이 같습니다. 두 모델 모두 텍스트·이미지·오디오·동영상을 입력으로 받고 함수 호출과 Google 검색 그라운딩을 지원합니다. 코드 실행, 파일 검색, 구조화 출력, URL 컨텍스트, 캐싱, Batch API는 지원하지 않습니다. 모델 카드에 따르면 두 모델은 Gemini 3 Pro를 기반으로 하고 지식 기준 시점은 2025년 1월입니다. 최신 정보를 답해야 하는 음성 에이전트라면 검색 그라운딩이나 직접 연결한 도구로 정보를 보충해야 합니다.

3.1 Flash Live Preview에서 옮길 때 바뀌는 설정

3.8 Live 모델 문서는 gemini-3.1-flash-live-preview에서 옮길 때 확인할 항목을 따로 정리했습니다. 모델 문자열을 gemini-3.8-live로 바꾸고 세션 설정에서 thinking_level이나 thinking_config를 빼는 것부터 시작합니다. 비동기 함수 호출이 기본값이 됐으므로 도구가 순서대로 실행된다고 가정한 코드라면 BLOCKING을 명시하거나 대화 흐름을 다시 점검해야 합니다.

기본 동작도 몇 가지 달라졌습니다. 입력이 관련 없으면 모델이 답하지 않기로 판단할 수 있는 proactive audio가 항상 켜져 있어 proactive_audio: false를 보내면 오류가 납니다. affective dialogue 기능은 API에서 제거돼 enable_affective_dialog 설정을 코드에서 지워야 합니다. 동영상 프레임은 기본적으로 모델에 전달되므로 문서는 필요할 때만 프레임을 보내 컨텍스트와 비용을 관리하라고 안내합니다.

3.1 Flash Live Preview는 이제 레거시 프리뷰 모델로 표시되며 Google은 3.8 Live로 업데이트하라고 권장합니다. 다만 지원 중단 일정 문서에는 9월 17일 확인 기준으로 3.1 Flash Live Preview의 종료일이 공지되지 않았습니다.

발표문 기준 Search Live와 Gemini Live에는 서로 다른 모델이 들어간다

발표문은 제품마다 어떤 모델이 들어가는지 나눠 적었습니다. 개발자는 두 모델 모두 Gemini API와 Google AI Studio에서 쓸 수 있고 Gemini API 릴리스 노트는 두 모델을 정식 제공(GA)으로 표시했습니다. 기업용 Gemini Enterprise에서는 두 모델 모두 비공개 프리뷰로 제공되며 Gemini Enterprise for Customer Experience에는 곧 제공될 예정입니다.

일반 이용자에게는 모델이 갈립니다. 발표문은 소비자 제품 적용을 모두 9월 15일부터 순차 진행한다고 적었습니다. 3.8 Live는 Google 검색의 Search Live에 순차 적용됩니다. Extended Thinking은 Gemini 앱의 Gemini Live와 Google AI Pro·Ultra 구독자의 Docs, 모든 Google AI 구독자의 Gmail·Keep에 순차 적용됩니다. Workspace 업무 계정에는 Extended Thinking이 곧 제공될 예정이라고 Google은 밝혔습니다.

제공 경로Gemini 3.8 LiveGemini 3.8 Live Extended Thinking
Gemini API·Google AI Studio제공제공
Gemini Enterprise비공개 프리뷰비공개 프리뷰
Gemini Enterprise for Customer Experience제공 예정제공 예정
Search Live순차 제공발표문 언급 없음
Gemini Live발표문 언급 없음순차 제공
Gmail·Keep발표문 언급 없음Google AI 구독자 대상 순차 제공
Docs발표문 언급 없음Google AI Pro·Ultra 구독자 대상 순차 제공
Workspace 업무 계정발표문 언급 없음제공 예정

Google은 자사 AI 제품이 생성한 모든 오디오에 사람이 인지할 수 없는 SynthID 워터마크를 넣는다고 밝혔습니다.

아직 확인되지 않은 부분

공식 자료만으로는 한국 이용자가 언제 어떤 조건에서 새 모델을 쓰게 되는지 알 수 없습니다. 발표문은 9월 15일부터 순차 제공한다고만 밝혔고 성능 수치도 Google이 고른 평가에서 나온 결과입니다. 도입을 판단하기 전에 아래 항목은 따로 확인해야 합니다.

한국 제공 범위와 한국어 지원

영문 발표문과 한국어판 발표문 모두 Gemini Live, Search Live, Workspace 기능의 국가·언어별 적용 일정을 밝히지 않았습니다. Gemini 앱 릴리스 노트에도 9월 17일 확인 기준 이번 모델에 관한 항목이 없었습니다. Search Live는 3월 3.1 Flash Live 발표 때 200개가 넘는 국가와 지역으로 확대됐지만 3.8 Live 전환이 모든 지역에 동시에 적용되는지는 발표되지 않았습니다. Workspace 기능 가운데 Gmail Live는 도움말에서 현재 영어로만 제공된다고 안내합니다.

지원 언어 수도 자료마다 다르게 적혀 있습니다. 발표문은 97개 언어를 언급했고 Live API 기능 가이드는 99개 언어를 지원한다며 그 표에 한국어를 포함했습니다. 반면 Live API 개요 문서는 70개 언어로 적고 있습니다. 모델별 한국어 음성 품질을 보여 주는 공식 수치는 찾지 못했습니다.

3.8 Live가 도구를 기다리는 동안의 발화

3.8 Live의 동작을 설명하는 문구도 자료마다 차이가 있습니다. Google 발표문은 3.8 Live가 백그라운드에서 도구를 실행하는 동안 요청을 확인하고 대화를 이어간다고 설명합니다. 반면 Thinking 가이드의 비교표는 3.8 Live가 도구 실행을 기다린 뒤 말한다고 적었고 처리 중 진행 발화는 Extended Thinking의 동작으로 구분했습니다. 도구 실행 중 사용자가 무엇을 듣게 되는지는 실제 시나리오로 시험해 봐야 합니다.

Google이 제시한 성능 수치

Google은 Extended Thinking이 Artificial Analysis의 Speech to Speech Quality Index에서 82.6으로 종합 1위를 기록했다고 밝혔습니다. τ-Voice에서는 68.6%, Sierra의 τ-Voice-banking에서는 35.1%, Big Bench Audio에서는 97.7%를 제시했습니다. 3.8 Live의 결과로는 Speech Agent Arena 2위를 들었습니다. ServiceNow의 EVA-Bench 결과는 Gemini Enterprise Agent Platform의 Live API에서 측정했다는 단서가 붙어 있습니다. 모두 Google이 발표한 결과이며 성공지식백과가 같은 조건으로 재현한 수치는 아닙니다.

음성 에이전트를 만든다면 먼저 시험할 것

개발자는 Google AI Studio의 Live 화면에서 두 모델을 바로 시험할 수 있습니다. 같은 요청을 3.8 Live와 Extended Thinking에 각각 보내 첫 발화까지 걸리는 시간, 최종 답까지 걸리는 시간, 세션별 토큰 사용량을 함께 기록하면 모델을 고를 근거로 쓸 수 있습니다. 도구가 짧게 끝나는 상담형 서비스라면 3.8 Live가 기본 선택지이고 조회나 계산이 몇 초씩 걸리는 서비스라면 Extended Thinking의 진행 발화가 실제 사용자에게 어떻게 들리는지 확인해야 합니다.

Google 개발자 블로그는 Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel, Vision Agents 같은 Live API 연동 파트너를 통해서도 두 모델을 쓸 수 있다고 안내했습니다. 이런 플랫폼으로 음성 에이전트를 운영한다면 Extended Thinking의 interaction_status와 비동기 함수 선언을 해당 플랫폼이 어떻게 처리하는지 플랫폼 문서에서 확인해야 합니다. 일반 이용자에게는 Gemini Live와 Search Live가 순차적으로 바뀌므로 계정마다 새 모델이 적용되는 시점이 다를 수 있습니다.

함께 읽으면 좋은 기사

출처

  1. Introducing Gemini 3.8 Live and 3.8 Live Extended ThinkingGoogle · 발행 · 확인
  2. ‘제미나이 3.8 라이브’ 및 ‘3.8 라이브 익스텐디드 씽킹’ 모델을 소개합니다Google Korea Blog · 확인
  3. Build real-time voice applications with Gemini 3.8 Live and 3.5 TranscribeGoogle · 발행 · 확인
  4. Thinking in the Live APIGoogle AI for Developers · 확인
  5. Gemini 3.8 Live | Gemini APIGoogle AI for Developers · 확인
  6. Gemini 3.8 Live Extended Thinking | Gemini APIGoogle AI for Developers · 확인
  7. Release notes | Gemini APIGoogle AI for Developers · 확인
  8. Gemini Developer API pricingGoogle AI for Developers · 확인
  9. Live API capabilities guideGoogle AI for Developers · 확인
  10. Tool use with Live APIGoogle AI for Developers · 확인
  11. Gemini Live API overviewGoogle AI for Developers · 확인
  12. Gemini deprecationsGoogle AI for Developers · 확인
  13. Gemini 3.8 Audio (Live, Live Extended Thinking) - Model CardGoogle DeepMind · 확인
  14. Gemini 3.1 Flash Live: Making audio AI more natural and reliableGoogle · 확인
  15. Talk naturally with Gmail LiveGmail Help · 확인
  16. Gemini Apps’ release updates & improvementsGoogle · 확인