GPT-Talk

Realtime Voice 完全指南:gpt-realtime 与 Voice Mode

How to ship low-latency voice AI with OpenAI's gpt-realtime / gpt-realtime-mini: WebRTC vs WebSocket, function calling mid-conversation, and Voice Mode best practices.

TL;DR
gpt-realtime 与 gpt-realtime-mini 是 OpenAI 当前的低延迟语音 API 家族,支持打断、语气识别、笑声回应,是 ChatGPT Voice Mode 的底层引擎。本文讲清 Realtime API 与 Voice Mode 的差别、WebRTC / WebSocket 选型、function calling 实战。
gpt-realtime 是 OpenAI 2026 年的低延迟多模态语音模型,模型能直接处理输入音频流并实时生成语音回复,端到端延迟约 300ms;gpt-realtime-mini 是低成本变体。

操作步骤

  1. 选 transport:浏览器走 WebRTC,服务端走 WebSocket

    浏览器端到端语音选 WebRTC(点对点低延迟);服务端中转或需要日志/编排选 WebSocket——服务端可以做语音活动检测、记录、转人工。

  2. 服务端发 ephemeral token 给客户端

    永远不要把长期 API Key 发到浏览器。服务端用 /v1/realtime/client_secrets 临时签发一个 1 分钟过期的 token,前端用这个 token 建连。

  3. 建第一个连接并发送一句问候

    用 session.update 配置 modalities=["audio","text"]、voice="alloy"、instructions="你是友好的助手",再发 conversation.item.create 加 response.create 让它先说一句。

  4. 打开 mid-conversation function calling

    在 session.update 的 tools[] 里声明你的函数;模型在听到合适语义时会自动触发函数调用,你返回工具结果后它会继续对话。

  5. 上线前排查延迟和资源占用

    用 VAD 关掉静音帧;用 input_audio_transcription 配置 server-side 转写便于审计;监控 first-audio-byte latency 目标 < 600ms。

Realtime Voice 完全指南:gpt-realtime 与 Voice Mode

gpt-realtime 是 OpenAI 2026 年的低延迟多模态语音模型,模型能直接处理输入音频流并实时生成语音回复,端到端延迟约 300ms;gpt-realtime-mini 是低成本变体。

1. 概述

gpt-realtime 与 gpt-realtime-mini 是 OpenAI 当前的低延迟语音 API 家族,支持打断、语气识别、笑声回应,是 ChatGPT Voice Mode 的底层引擎。本文讲清 Realtime API 与 Voice Mode 的差别、WebRTC / WebSocket 选型、function calling 实战。

2. 核心要点

  • Realtime API 与 Voice Mode:前者面向开发者,开放 gpt-realtime / gpt-realtime-mini;后者是 ChatGPT 内置产品
  • WebRTC 走浏览器,适合点对点、低延迟;WebSocket 走服务端,更可控,便于记录
  • 支持 mid-conversation function calling,可以在对话中调用天气、订单、日历等工具
  • 内置音色包括:alloy、ash、ballad、coral、echo、fable、nova、onyx、sage、shimmer、verse;可调 temperature 控制语气变化
  • 生产部署必须用 ephemeral token 鉴权,避免长期 API Key 泄露

3. 工作机制

下面分节展开。建议阅读时配合 OpenAI Realtime API 文档 一起看。

4. 实战步骤

  1. 明确目标:先定义完成的标准。
  2. 选型:参考核心要点里的模型对比。
  3. 验证:跑通最小示例,记录参数与版本号。
  4. 集成:把示例接到你现有代码里。
  5. 监控:记录调用日志与失败原因,定期回看。

5. 常见错误与排查

  • 报错 401:API Key 无效或过期,重新生成。
  • 报错 429:触发速率限制,启用指数退避重试。
  • 报错 400:参数错误,仔细核对 model 名称与 messages 结构。
  • 回答质量差:换模型、补充 few-shot 示例、检查 prompt 是否过长。

6. 下一步

掌握本文后,建议继续阅读:

  • 《ChatGPT 完全指南(2026):从入门到精通》
  • 《Prompt Engineering 核心模式:8 个让 GPT 表现翻倍的模板》
  • 《OpenAI API 入门:第一个 GPT-5.6 调用详解》

关键要点

  • Realtime API 与 Voice Mode:前者面向开发者,开放 gpt-realtime / gpt-realtime-mini;后者是 ChatGPT 内置产品
  • WebRTC 走浏览器,适合点对点、低延迟;WebSocket 走服务端,更可控,便于记录
  • 支持 mid-conversation function calling,可以在对话中调用天气、订单、日历等工具
  • 内置音色包括:alloy、ash、ballad、coral、echo、fable、nova、onyx、sage、shimmer、verse;可调 temperature 控制语气变化
  • 生产部署必须用 ephemeral token 鉴权,避免长期 API Key 泄露

常见问题

ChatGPT Voice Mode 是 ChatGPT 应用里的消费级功能——打开手机 App、点语音图标、说话。Realtime API 是面向开发者的接口,通过 WebRTC 或 WebSocket 暴露 gpt-realtime / gpt-realtime-mini,让你做自己的语音产品。Voice Mode 底层就是用同一个模型族,但只有当你做自己的 App 时才会直接用 API。

官方参考

订阅 GPTMap Weekly

每周一封邮件,精选 OpenAI 重要更新、深度解读与最佳实践。无广告,可随时退订。

GPTMap Editorial发布于 2026-07-12更新于 2026-07-14 3 分钟阅读
测试环境(EEAT)
最后测试时间:2026-07-14
使用模型:gpt-realtime