최근 이슈 · 2026-09-16
한 주에 나온 실시간 음성 AI 둘과 악용 보고서
이 글은 AI로 수집한 결과입니다. 원문 기사와 발표 자료를 대조해 정리했지만, 최종 확인은 출처 원문에서 해 주세요. 자료 수집 2026-09-16 10:25.
한 줄로
9월 10일과 15일, 오픈AI와 구글이 사람과 실시간으로 말을 주고받는 음성 모델을 각각 내놨습니다. 같은 주에 앤트로픽은 자사 모델이 악용된 사례를 모은 보고서를 냈고, 거기에 남의 목소리를 복제해 실시간으로 대화한 사례가 들어 있습니다.
이번 주 소식
2026년 9월 16일 오전 10시 25분(한국 시간)에, 발표 기관의 공식 발표문을 직접 열어 확인한 것입니다.
| 소식 | 날짜 | 기관 |
|---|---|---|
| GPT-Live-1 API 공개 | 9월 10일 | 오픈AI |
| Gemini 3.8 Live 2종 공개 | 9월 15일 | 구글 딥마인드 |
| 악용 탐지·대응 보고서 | 9월 10일 | 앤트로픽 |
오픈AI — 듣는 동시에 말하는 모델
지금까지 음성 비서는 말을 글로 바꾸고, 생각하고, 다시 글을 말로 바꾸는 세 단계를 이어 붙여 만들었습니다. 발표문은 이 방식이 단계마다 지연이 쌓이고 대화의 흐름을 놓치기 쉽다고 지적하면서, GPT-Live-1은 듣기와 말하기를 한 모델에서 함께 처리한다고 설명합니다.
- 가격은 프런트엔드 음성 계층 기준 분당 0.05달러라고 적었습니다. 뒤에서 생각을 맡는 모델 값은 따로입니다.
- 자체 평가에서 Full Duplex Bench 성적이 이전 모델(GPT-Realtime-2.1)보다 30퍼센트포인트 올랐다고 밝혔습니다. 절대 점수는 발표문에 없습니다.
- 어학 학습 서비스 Speak의 초기 평가에서, 학습자가 생각하는 동안 끼어드는 일이 기존 방식보다 거의 80% 줄었다고 소개했습니다.
- 전화 통화용 음성 상담원에 쓸 수 있다고 적었습니다.
구글 — 말하면서 뒤에서 일을 처리
구글 딥마인드는 Gemini 3.8 Live와 3.8 Live Extended Thinking 두 가지를 9월 15일에 내놨습니다. 발표문이 든 점수는 모두 Extended Thinking 쪽 값입니다.
- Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 1위라고 밝혔습니다.
- τ-Voice 68.6%, Sierra의 τ-Voice-banking 35.1%, Big Bench Audio 97.7%를 적었습니다.
- Gemini 3.8 Live 쪽 설명으로는, 대화 도중 97개 언어를 자동으로 알아채고 바꿔 가며 말한다고 합니다.
- 도구 호출을 뒤에서 돌리면서 대화는 계속 이어 간다고 설명합니다.
- 구글이 만든 음성에는 모두 SynthID 워터마크가 들어간다고 밝혔습니다.
- 토큰 단가는 발표문에 없습니다. 경쟁력 있는 가격이라는 표현만 있습니다.
앤트로픽 — 같은 주에 나온 악용 보고서
앤트로픽은 2025년 12월부터 2026년 8월까지 자사가 차단한 악용 활동을 일곱 개 영역으로 나눠 정리했습니다. 공개 날짜는 회사 뉴스 목록 페이지에 9월 10일로 적혀 있습니다.
아이를 키우는 입장에서 눈에 띄는 것은 데이팅 앱 사기 사례입니다. 보고서는 중국에 있는 앱 제작사가 데이팅 앱 스무 개가 넘는 망을 만들고, 사람이 응대한다고 광고하면서 실제로는 AI가 대화했다고 적었습니다. 2026년 4월의 2주 동안 서로 다른 AI 인격 4,700개 이상이 최소 25,000명과 대화했고, 메시지는 약 236만 건이었다고 밝혔습니다. 영상 통화나 SNS 확인처럼 진짜 사람인지 보는 절차에는 실제 사람을 섞어 넣었다고도 적었습니다.
음성과 직접 닿는 대목도 있습니다. 한 영향력 공작 사례에서는 실제 활동가의 개인 메시지에서 목소리를 복제한 뒤, 그 사람인 척 이란 안의 지인들과 실시간으로 대화했다고 보고서는 설명합니다.
누구에게 무슨 의미인가
여기까지가 발표문에 적힌 사실이고, 아래는 저희 추정입니다.
- 일반 이용자: 걸려 오는 전화의 상대가 사람인지 AI인지 구분하기 어려워지는 쪽으로 갑니다. 목소리가 자연스러우니 사람일 것이라는 판단은 근거가 약해집니다.
- 부모: 아이가 쓰는 앱에서 사람과 대화한다는 안내가 사실인지 확인하기 어려워집니다. 앤트로픽이 든 사례가 광고와 실제가 달랐던 경우입니다.
- 만드는 쪽: 두 회사 모두 끊기지 않는 대화를 앞세웠습니다. 음성 제품의 경쟁 기준이 알아듣는 정확도에서 대화의 자연스러움 쪽으로 옮겨 가는 것으로 보입니다.
확인하지 못한 것
- 직접 써 보지 않았습니다. 두 음성 모델 모두 저희가 실행해 성능을 재지 않았고, 위 수치는 전부 발표한 회사가 자기 발표문에 적은 값입니다.
- 평가 조건: 각 점수가 어떤 조건에서 나왔는지, 제3자가 같은 결과를 냈는지는 확인하지 못했습니다.
- 한국어가 얼마나 되는지: 97개 언어에 한국어가 어떻게 포함되고 얼마나 잘 되는지는 발표문에 없습니다.
- 실제 비용: 오픈AI의 분당 0.05달러는 음성 계층만의 값이라, 뒤에 붙이는 모델 비용을 합한 값은 알 수 없습니다. 구글은 가격 수치를 밝히지 않았습니다.
- 보고서 공개 시각: 앤트로픽 보고서 본문에는 날짜가 없어, 9월 10일은 회사 뉴스 목록 페이지의 표기를 따랐습니다.
출처
- OpenAI, Build more natural voice experiences with GPT-Live-1 in the API (2026-09-10) https://openai.com/index/introducing-gpt-live-1-in-the-api/
- Google DeepMind, Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (2026-09-15) https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/
- Google 블로그, 같은 발표문 https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
- Anthropic, Detecting and countering misuse of AI: September 2026 https://www.anthropic.com/threat-intelligence-report-september-2026
- Anthropic 뉴스 목록 (공개일 근거) https://www.anthropic.com/news