Skip to content

实时语音与 Live 协作模式 ​

在 Piwin 的输入区(Composer)右侧,有一个精致的小麦克风图标。这就是 Piwin 内置的**全双工实时语音(Live Realtime Voice)**功能。

它不是传统的单向 ASR 语音输入法,而是让智能体具备像真人结对编程一样“边聊天、边下发需求、边实时写代码”的次世代协作体验。


1. 为什么做实时语音?它与传统语音输入的区别 ​

传统的 ASR(如讯飞、系统听写)仅仅把你说的话转成文字填进输入框,依然需要手动点击发送等待模型回复。

而在真实的软件工程场景中:

  • 开发者经常需要一边盯着代码或调试页面,一边用口语与助手探讨方案;
  • 助手需要在后台默默推进任务(改代码、跑单测),同时在语音中简短汇报关键进展(Key Takeaway);
  • 全双工打断:你可以随时插话纠正思路,而无需重开会话。

全双工实时语音协作特性图解


2. 架构设计:说话面与工作面分离 (Live Spoken Contract) ​

Piwin 在底层设计了严格的 说话面契约(Live Spoken Contract):

text
┌──────────────────────┐       交接任务 (Handover)       ┌──────────────────────┐
│  说话面 (实时语音流)  │ ─────────────────────────────> │  工作面 (执行智能体)  │
│ • 自然闲聊与方案探讨  │ <───────────────────────────── │ • 文件读写与工程修改  │
│ • 提炼简报与口误纠正  │        返回结果结论            │ • 运行单测与验证      │
└──────────────────────┘                                └──────────────────────┘
  • 说话面(Speaking Face):负责自然的实时对话交互。寒暄、语气词、方案探讨留在通话流中;只有当用户明确要求修改文件、调用工具或跑测试时,才提炼出任务简报交接给工作面;
  • 工作面(Chat Agent):在会话中具体执行代码修改与测试验证;任务完成后,说话面以极简的一句话告知结论,绝不进行冗长的新闻播报。

3. 支持的语音模型与接入渠道 ​

打开客户端 「设置」➔「实时语音 (Live Voice)」:

全双工实时语音 Live 通话中

渠道 1:OpenAI Codex OAuth 登录 ​

如果你在 OAuth 登录 中绑定了 OpenAI Codex 账号,系统会自动使用 Codex 套餐中的官方 Live 实时语音模型。

渠道 2:OpenAI Realtime 协议兼容端点 ​

支持填入任何实现了标准 OpenAI WebSocket Realtime 协议的 Base URL 与 API Key。

渠道 3:xgrok / Grok2API 等社区转换通道 ​

如果你有一些免费的 xAI Grok 账号,支持通过社区开源的 xgrok 或 Grok2API(利用 Grok Web 端逆向通道桥接转标准 OpenAI Realtime WebSocket 协议,如 wss://.../v1/realtime,语音模型填入 grok-voice-think-fast)零成本接入实时全双工语音流。


4. 常见问题 ​

1. 为什么说话时没有扣除常规 Chat 模型的额度?

实时语音走专属的 WebRTC / WebSocket 流式音频通道,采用按音频时间计费或绑定特定账号的 Live 协议,与普通文本模型的计费分离。

2. 通话中可以打断吗?

完全支持。由于采用全双工流式传输,在助手发声的同时你随时开口,助手会自动静音并倾听你最新的指示。


5. 关联文档 ​

Released under the MIT License.