OpenAI 计划为 ChatGPT 语音模式推出名为 GPT-Bidi-1 的双向音频模型,旨在实现真正的实时语音交互并大幅提升语音推理能力。

ChatGPT 语音模式升级至 GPT-Bidi-1 的概念图

GPT-Bidi-1 实现双向音频实时交互

据 Testingcatlog 报道,OpenAI 正在准备发布名为 GPT-Bidi-1 的次世代音频模型。该模型采用了双向 (Bidirectional) 架构,设计目标是让 AI 能够同时听取并输出语音,从而在对话中实时吸收中断信号,并在用户发出语气词 (如 “mm-hm”) 时能够在中途调整语序,而非像当前版本那样在被中断时陷入停顿。

此次升级旨在弥补 OpenAI 在语音技术上的代差。虽然文本模型已迭代至 GPT-5.5 世代,但语音模式仍基于较旧的音频栈。OpenAI 试图通过 GPT-Bidi-1 缩小语音与文本在推理能力上的差距,以支撑其未来音频优先 (Audio-first) 的硬件计划及语音支持工具。

GPT-Bidi-1 的分级模式与交互设计

在功能形态上,ChatGPT 用户预计将获得一个切换选项,可以在当前的 Advanced Voice Mode 与全新的 Bidi (Latest) 模式之间自由切换,而非强制全体迁移。

为了在响应速度与思考深度之间取得平衡,GPT-Bidi-1 将引入与文本模式类似的智能等级划分,包含 High(高)、Medium(中) 和 Instant(即时) 三档。用户可根据具体任务需求,在极致速度与深度推理之间进行权衡。

此外,近期 ChatGPT 界面中出现的语音气泡可拖拽至屏幕中央的改动,被认为该音频模式重新设计的一部分。最新的进展显示,Bidi 1 目前正准备在 Web 端上线。

尽管相关基础设施已基本铺就,但具体发布时间尚未最终敲定,其内部代号在正式发布前可能还会发生变动。


评论 0

订阅评论
提醒
guest
0 评论
最旧
最新 最多投票
内联反馈
查看所有评论
0
希望看到您的想法,请您发表评论x