实时语音与 Live 协作模式
在 Piwin 的输入区(Composer)右侧,有一个精致的小麦克风图标。这就是 Piwin 内置的**全双工实时语音(Live Realtime Voice)**功能。
它不是传统的单向 ASR 语音输入法,而是让智能体具备像真人结对编程一样“边聊天、边下发需求、边实时写代码”的次世代协作体验。
1. 为什么做实时语音?它与传统语音输入的区别
传统的 ASR(如讯飞、系统听写)仅仅把你说的话转成文字填进输入框,依然需要手动点击发送等待模型回复。
而在真实的软件工程场景中:
- 开发者经常需要一边盯着代码或调试页面,一边用口语与助手探讨方案;
- 助手需要在后台默默推进任务(改代码、跑单测),同时在语音中简短汇报关键进展(Key Takeaway);
- 全双工打断:你可以随时插话纠正思路,而无需重开会话。

2. 架构设计:说话面与工作面分离 (Live Spoken Contract)
Piwin 在底层设计了严格的 说话面契约(Live Spoken Contract):
text
┌──────────────────────┐ 交接任务 (Handover) ┌──────────────────────┐
│ 说话面 (实时语音流) │ ─────────────────────────────> │ 工作面 (执行智能体) │
│ • 自然闲聊与方案探讨 │ <───────────────────────────── │ • 文件读写与工程修改 │
│ • 提炼简报与口误纠正 │ 返回结果结论 │ • 运行单测与验证 │
└──────────────────────┘ └──────────────────────┘- 说话面(Speaking Face):负责自然的实时对话交互。寒暄、语气词、方案探讨留在通话流中;只有当用户明确要求修改文件、调用工具或跑测试时,才提炼出任务简报交接给工作面;
- 工作面(Chat Agent):在会话中具体执行代码修改与测试验证;任务完成后,说话面以极简的一句话告知结论,绝不进行冗长的新闻播报。
3. 支持的语音模型与接入渠道
打开客户端 「设置」➔「实时语音 (Live Voice)」:

渠道 1:OpenAI Codex OAuth 登录
如果你在 OAuth 登录 中绑定了 OpenAI Codex 账号,系统会自动使用 Codex 套餐中的官方 Live 实时语音模型。
渠道 2:OpenAI Realtime 协议兼容端点
支持填入任何实现了标准 OpenAI WebSocket Realtime 协议的 Base URL 与 API Key。
渠道 3:xgrok / Grok2API 等社区转换通道
如果你有一些免费的 xAI Grok 账号,支持通过社区开源的 xgrok 或 Grok2API(利用 Grok Web 端逆向通道桥接转标准 OpenAI Realtime WebSocket 协议,如 wss://.../v1/realtime,语音模型填入 grok-voice-think-fast)零成本接入实时全双工语音流。
4. 常见问题
1. 为什么说话时没有扣除常规 Chat 模型的额度?
实时语音走专属的 WebRTC / WebSocket 流式音频通道,采用按音频时间计费或绑定特定账号的 Live 协议,与普通文本模型的计费分离。
2. 通话中可以打断吗?
完全支持。由于采用全双工流式传输,在助手发声的同时你随时开口,助手会自动静音并倾听你最新的指示。
