/// NOTES · 연재 032

말로 먼저 걸어본다 — 제미나이 3.8 라이브 켜보기

이 글은 그날 쓴 것이 아니다. 9월 15일 구글이 제미나이 3.8 라이브를 내놓았는데, 그날은 지나갔다가 지금 공식 문서를 다시 열어 확인해 적는다. 타이핑 없이 말로 묻고 말로 답을 듣는 모델이고, AI 스튜디오에서 로그인만 하면 오늘 바로 무료로 켜볼 수 있다는 것까지 확인했다.

2026-09-23· 분류 : 기능· 직접 해 보기 5분· 나중에 채운 글

무엇이 바뀌었나

확인 구글 공식 블로그에 따르면 2026년 9월 15일 제미나이 3.8 라이브와 제미나이 3.8 라이브 익스텐디드 씽킹 두 모델이 함께 나왔다. 둘 다 텍스트를 거치지 않고 음성을 바로 듣고 음성으로 바로 답하는 네이티브 스피치-투-스피치 모델이라고 적혀 있다.

모델초점근거
제미나이 3.8 라이브 규모·비용 효율. 자연스러운 대화 + 화면을 보며 답하는 비주얼 그라운딩 확인
제미나이 3.8 라이브 익스텐디드 씽킹 복잡한 작업. 말하면서 동시에 여러 단계로 추론 확인

확인 공식 가격 문서(ai.google.dev/gemini-api/docs/pricing)에는 두 모델의 API 가격도 나와 있다. 오디오는 분당으로도, 토큰당으로도 매겨진다.

항목가격 (유료 등급)근거
텍스트 입력100만 토큰당 $0.75확인
오디오 입력100만 토큰당 $3.00 (분당 $0.005)확인
오디오 출력100만 토큰당 $12.00 (분당 $0.018)확인
무료 등급 포함 여부포함됨 (신용카드 없이 시작 가능)확인

왜 중요한가 — 말도 결국 토큰이다

이 사이트 교육 과정 L0·04 토큰 · 컨텍스트 · 환각에서 "AI는 글자를 토큰이라는 덩어리로 잘라 센다"고 적었다. 이번 표를 보면 음성도 다르지 않다 — 말하는 시간이 길어질수록, 듣는 답이 길어질수록 토큰(또는 분)이 쌓이고 그만큼 값이 붙는다. 화면에 글자가 안 보인다고 공짜로 계속 떠들 수 있는 게 아니라는 뜻이다.

지난 제미나이 3.8 플래시 글에서 다룬 "AI 스튜디오에서 API 키 없이도 무료로 눌러 본다"는 접근법이 이번에도 그대로 통한다. 다만 이번엔 채팅창이 아니라 마이크가 입력 도구다.

이 글의 한계

추정 AI 스튜디오의 실시간 화면(Stream 모드)에서 시스템 프롬프트를 직접 입력하는 칸이 있는지는 문서마다 표현이 조금씩 달랐다. API로 직접 호출할 때는 시스템 지침을 넣을 수 있다는 게 공식 문서에 명시돼 있지만, 코드 없이 화면만 쓸 때도 똑같이 되는지는 직접 화면을 열어 확인하는 편이 정확하다.

확인 못 함 무료 등급의 분당·일일 사용 한도는 문서에 구체적인 숫자가 없었다. 많이 써 보고 싶다면 콘솔의 할당량 화면에서 직접 확인하는 게 맞다.

직접 해 보기 — 5분

  1. aistudio.google.com/live를 연다. 확인 구글 계정으로 로그인만 하면 되고, 결제 정보를 걸지 않으면 무료 등급으로 쓰인다 — 지난 플래시 글과 같은 방식이다.
  2. 모델을 고른다. 사이드바에서 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking 중 하나를 고른다. 빠른 잡담이면 앞쪽, 여러 단계로 생각해야 하는 질문이면 뒤쪽이 낫다.
  3. Talk · Webcam · Share Screen 중 하나를 고른다. 말만 하고 싶으면 Talk, 카메라로 뭔가를 보여주며 물어보고 싶으면 Webcam이다. 마이크 권한을 허용하면 음성 활동 감지가 자동으로 돈다 — 버튼을 계속 누르고 있을 필요가 없다.
  4. 사이드바에서 음성(voice)을 하나 골라 본다. 말투와 톤이 다른 여러 목소리 중에서 고를 수 있다. 말하는 도중에 끼어들어도 모델이 멈추고 새 말을 듣는지 확인해 본다.
  5. 짧은 질문을 소리 내어 물어본다.
    지금부터 3분 동안 요리할 수 있는
    간단한 계란 요리 하나 추천해 줘.
    재료는 한 가지씩 말해 줘
    답이 끝나기 전에 "아니 계란 말고 두부로" 라고 중간에 끼어들어 본다. 말을 끊고 새로 반영하는지가 이 모델의 핵심 포인트다.

한 줄 정리

  1. 9월 15일 나온 제미나이 3.8 라이브는 텍스트를 거치지 않고 말로 묻고 말로 답하는 모델이다.
  2. aistudio.google.com/live에서 로그인만 하면 무료로 켜볼 수 있다.
  3. 화면에 글자가 안 보여도 말하고 듣는 시간만큼 토큰(분)이 쌓인다 — 공짜로 무제한이 아니다.
이어 읽기 L0 · 04 토큰 · 컨텍스트 · 환각 — 글자를 세던 토큰이 음성에서는 분·초 단위로도 매겨진다는 것. →
SOURCES
  1. Google — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (발표일 · 두 모델 차이)
  2. Google AI for Developers — Gemini API pricing (모델 ID · 오디오 분당/토큰당 가격 · 무료 등급 포함 여부)
  3. Google AI for Developers — Live API capabilities guide (음성 선택 · AI 스튜디오 연결)
  4. DataCamp — Google AI Studio Tutorial (Stream 모드의 Talk·Webcam·Share Screen 구성)
  5. Simon Willison — Gemini Live audio (직접 써 본 후기 · 참고용)