OpenAI 拟推出 GPT-Bidi-1 双向音频模型升级 ChatGPT 语音模式
OpenAI 计划为 ChatGPT 语音模式推出名为 GPT-Bidi-1 的双向音频模型,旨在实现真正的实时语音交互并大幅提升语音推理能力。

GPT-Bidi-1 实现双向音频实时交互
据 Testingcatlog 报道,OpenAI 正在准备发布名为 GPT-Bidi-1 的次世代音频模型。该模型采用了双向 (Bidirectional) 架构,设计目标是让 AI 能够同时听取并输出语音,从而在对话中实时吸收中断信号,并在用户发出语气词 (如 “mm-hm”) 时能够在中途调整语序,而非像当前版本那样在被中断时陷入停顿。
此次升级旨在弥补 OpenAI 在语音技术上的代差。虽然文本模型已迭代至 GPT-5.5 世代,但语音模式仍基于较旧的音频栈。OpenAI 试图通过 GPT-Bidi-1 缩小语音与文本在推理能力上的差距,以支撑其未来音频优先 (Audio-first) 的硬件计划及语音支持工具。
GPT-Bidi-1 的分级模式与交互设计
在功能形态上,ChatGPT 用户预计将获得一个切换选项,可以在当前的 Advanced Voice Mode 与全新的 Bidi (Latest) 模式之间自由切换,而非强制全体迁移。
为了在响应速度与思考深度之间取得平衡,GPT-Bidi-1 将引入与文本模式类似的智能等级划分,包含 High(高)、Medium(中) 和 Instant(即时) 三档。用户可根据具体任务需求,在极致速度与深度推理之间进行权衡。
此外,近期 ChatGPT 界面中出现的语音气泡可拖拽至屏幕中央的改动,被认为该音频模式重新设计的一部分。最新的进展显示,Bidi 1 目前正准备在 Web 端上线。
尽管相关基础设施已基本铺就,但具体发布时间尚未最终敲定,其内部代号在正式发布前可能还会发生变动。

评论 0