Voice
Realtime Voice 与语音模式
GPT-Realtime-2.1 是 OpenAI 当前的低延迟语音 API 家族,支持打断、语气识别、笑声回应,也是 ChatGPT Voice Mode 的底层引擎。本频道讲清 Realtime API 与 ChatGPT Voice Mode 的差别、WebRTC / WebSocket 选型、mid-conversation function calling 实战。
共 6 篇文章
本频道你会学到什么
以下是这个频道覆盖的核心主题,每篇精选文章都会围绕其中若干点展开。
- GPT-Realtime-2.1
- WebRTC vs WebSocket
- Voice Mode
- 六种语音
- Ephemeral Token
- Function Calling
Live API 现身 OpenAI SDK:gpt-live-1、WebRTC/WebSocket 双通道与 SIP 通话控制解读
2026-09-10 的 openai-python v3.12.0 与 openai-node v7.14.0 落地了一个全新的 Live API:POST /live/sessions 建 WebRTC 会话、WebSocket 直连、accept/reject/hangup/refer 四个 SIP 通话控制端点、录音下载与 sideband 附着。会话配置里出现了新模型字面量 gpt-live-1。本文只写能在 SDK 源码里指出的东西。
阅读全文GPT-Realtime-2.1 端到端 vs ASR+LLM+TTS 管线:语音方案选型对比
做语音产品,用 Realtime 端到端还是自拼 ASR+LLM+TTS 管线?本文从延迟、打断、可控性、部署形态、多语言五个维度对比,并给出场景化选型建议。
阅读全文Realtime API 多语言实战:zh / en / ja 自动识别 + 跨语言对话 + 方言鲁棒性
GPT-Realtime-2.1 多语言能力:自动识别用户语言(zh / en / ja / ko / es 等)、跨语言对话(中英混说)、方言鲁棒性(粤语 / 四川话)、translate mode 自动翻译。
阅读全文Realtime Voice Agent 实战:电话客服 / 语音助手场景的 Realtime API + function calling
把 GPT-Realtime-2.1 接到电话 / 语音助手做实时语音 agent:WebRTC / WebSocket 选型 + VAD(server_vad)调优 + mid-conversation function calling + 双工/打断 + 通话质量监控。
阅读全文Advanced Voice 深度使用手册:GPT-Realtime-2.1 实战与延迟优化
GPT-Realtime-2.1 + ChatGPT Advanced Voice 全栈实战:WebRTC 与 WebSocket 选型、Turn Detection 调优、中途函数调用、VAD 参数、延迟优化与生产部署。
阅读全文Realtime Voice 完全指南:gpt-realtime 与 Voice Mode
用 gpt-realtime / gpt-realtime-mini 构建低延迟语音 AI:WebRTC 与 WebSocket 选型、对话中的 function calling,以及 Voice Mode 最佳实践。
阅读全文