人工智能的移动端交互方式正在迎来一次颠覆式的变革。OpenAI 近期正式宣布,在其 ChatGPT 移动应用中全面引入基于语音的智能代理(Agent)功能。这意味着,用户未来在使用手机时,不仅可以像过去一样通过语音与 AI 进行日常闲聊,更能够直接通过口头指令指挥 AI 穿梭于各种外部应用和工具之间,在后台自主执行跨步骤的复杂实际工作。

从核心功能来看,此次更新将 ChatGPT 此前在桌面端备受好评的 Work 核心能力完整移植到了手机端。针对 Plus 和 Pro 订阅用户,手机端的 Work 标签页现在可以直接用于创建文档、起草电子邮件以及总结 Slack 消息等高频办公任务;同时,它还支持进一步扩展至更复杂的应用场景,例如开展网站建设、制作演示文稿、调用云端浏览器甚至是处理各类财务相关的复合型任务。而对于 Free 和 Go 用户,OpenAI 则重点开放了对各类插件以及已连接外部应用的支持,确保不同层级的用户都能享受到智能工具带来的效率跃升。

在交互体验与底层逻辑上,全新的移动端更新对语音模式进行了全方位的深度优化。在交流过程中,用户不仅能够听到流畅的语音回应,还可以在屏幕上同步看到更加完整、清晰的文本输出信息。对于 Plus 订阅用户而言,应用界面提供了更加便捷的无缝切换机制,允许用户在文字和语音模式之间自由跳转,而不必繁琐地结束当前对话再重新开始。此外,跨设备的连续工作能力也让整个流程变得无比顺畅:用户完全可以在通勤或外出的碎片时间里,通过手机语音向 ChatGPT 下达任务指令,随后回到电脑前继续查看和收尾,实现多端协同的无缝衔接。

回顾其技术演进轨迹,这一功能升级并非偶然。今年7月,OpenAI 推出了全新的 GPT-Live 语音模型,重点突破了自然对话、打断处理以及连续交流的技术瓶颈,随后迅速将其下放到桌面端,赋能 Codex 软件开发和桌面智能代理。而此次向移动端的延伸,标志着 OpenAI 正在重新定义手机应用的功能定位——过去主要承担问答与搜索的“对话框”,如今已经正式演变为能够调度外部工具、替代人类执行多步骤操作的“超级入口”。随着语音、智能代理与跨设备生态的加速融合,未来用户只需说出目标,AI 便会接管后续的繁琐操作。