OpenAI近日宣布,将目前用于ChatGPT语音功能的GPT-Live-1正式开放给开发者使用。开发者现在可以通过API把这一语音模型集成到自己的应用和业务流程中,构建能够实时听取用户讲话、同时进行回应的全双工语音助手。该模型的语音前端价格为每分钟0.05美元,后台用于复杂推理的模型则需要按照相应的模型价格另外计费。

GPT-Live-1是OpenAI今年推出的新一代实时语音模型,最大的特点是采用全双工架构。传统语音AI通常需要依次完成语音识别、语言模型推理和语音合成三个步骤,用户说完话后系统才能开始处理并生成回答。而GPT-Live-1可以在听取用户讲话的同时生成语音输出,因此能够更自然地处理打断、停顿、附和以及快速的来回对话。
这意味着用户不必每次都等AI彻底说完才能继续讲话。如果用户中途改变想法、补充信息或者直接打断,GPT-Live-1可以根据正在发生的对话及时调整自己的行为。模型还能够判断什么时候应该继续说话、什么时候应该暂停、什么时候继续倾听,以及什么时候需要调用工具。
OpenAI表示,这种架构能够明显降低语音交互中的延迟,并解决传统“语音识别+大语言模型+语音合成”流水线在实际对话中容易出现的衔接问题。由于GPT-Live-1本身同时处理输入和输出音频,开发者无需再自行协调多个独立模型之间的复杂切换。
在OpenAI公布的测试中,GPT-Live-1在Full Duplex Bench测试中的表现相比GPT-Realtime-2.1提高了30个百分点,尤其是在轮流发言延迟以及交互行为方面取得了明显提升。在与GPT-6 Astra以中等推理强度配合时,GPT-Live-1在Tau3测试中也取得了第一名。Tau3主要用于评估语音智能体完成端到端任务的能力。
GPT-Live-1还有一个重要特点,就是它并不负责所有复杂的推理工作。OpenAI将负责实时听说和交互的语音模型与负责深度推理的后台模型进行了分离。当用户提出需要搜索、复杂分析或者执行较长任务的问题时,GPT-Live-1可以把这些工作交给后台模型,同时继续维持与用户的自然语音交流。
开发者因此可以根据具体业务需求自由选择后台模型。例如,对于预约、订单更新等大量简单任务,可以使用速度更快、成本更低的模型;对于复杂的客户问题,则可以交给更强的推理模型处理。这种架构允许开发者在响应速度、推理能力和使用成本之间自行寻找平衡。
OpenAI表示,这种分离式设计也能够让GPT-Live-1在后台执行任务时继续与用户保持交流,而不是让用户面对一段漫长的沉默等待时间。模型可以继续进行自然的对话,同时在后台完成更加复杂的工作,待任务完成后再把结果带回当前对话。
实际应用已经开始出现。OpenAI展示的早期案例包括Yelp Host和Hatch等语音服务,以及语言学习平台Speak。Speak在早期评估中发现,与此前基于轮次的语音系统相比,GPT-Live-1可以给语言学习者更多思考时间,使系统主动打断用户的情况减少了接近80%。
对于企业而言,这种能力尤其适合客户服务、电话客服、预约以及其他需要连续语音交互的场景。GPT-Live-1原生支持电话场景,因此开发者可以利用它构建能够接听和处理电话的全双工语音智能体,例如餐厅预约、客户支持以及其他需要实时交流的业务。
GPT-Live-1还提供原生的自动语音识别转写文本和模型响应文本,并增强了对字母数字组合的理解能力,同时支持关键词偏置功能。虽然它并不是传统意义上的轮次式模型,但仍然原生支持轮次检测,因此开发者如果需要明确控制用户什么时候说完、系统什么时候开始回答,仍然可以围绕明确的对话轮次进行应用设计。
对于背景环境较为嘈杂的场景,GPT-Live-1也进行了优化。模型能够更好地区分用户讲话、背景噪声和静默状态,不会因为周围环境中的声音就频繁打断对话,也不会在用户只是短暂思考时不断出声提醒。这种能力对于电话、客服以及真实环境中的移动语音助手尤其重要。
OpenAI同时扩大了GPT-Live-1可使用的声音选择。与此前数量相对有限的实时语音相比,新版本提供了更多不同的声音,并覆盖更加丰富的口音、方言和语言。OpenAI表示,未来几个月还会继续增加可用声音和语言。
在模型的部署方式上,开发者并不需要把所有任务都交给GPT-Live-1完成。OpenAI希望将其作为负责实时语音交互的前端,通过后台模型和智能体框架承担更加复杂的工作。这种方式也让开发者可以按照不同任务的实际需求组合不同模型。
例如,开发者可以让GPT-Live-1负责接收用户的语音请求、维持自然对话以及处理打断,然后把需要复杂推理的问题交给后台模型;后台模型完成工作后,再由GPT-Live-1将结果转换成自然的语音回答。对于需要调用外部工具的应用,这一机制同样适用。
OpenAI还展示了将GPT-Live-1与Codex等工具结合的方式。开发者可以让语音模型接收用户提出的任务,然后把相关上下文交给Codex等后台工具处理,再将处理结果返回给GPT-Live-1,由后者继续与用户进行语音交流。
价格方面,GPT-Live-1目前已经正式通过OpenAI API提供,语音前端的收费标准为每分钟0.05美元。需要注意的是,这只是实时语音层的费用。如果开发者为GPT-Live-1配备后台推理模型,那么后台模型的调用费用还需要按照对应的模型定价另行计算。
这意味着,对于需要大量语音通话的商业应用而言,实际成本并不只是每分钟0.05美元,而是由语音连接时间以及后台模型的推理消耗共同构成。不过开发者可以通过选择不同的后台模型,根据任务复杂程度控制整体成本。
GPT-Live-1的开放也意味着,OpenAI正在把ChatGPT语音模式背后的核心技术进一步从消费级产品延伸到开发者生态。此前,GPT-Live-1主要作为ChatGPT的语音交互能力存在,如今开发者可以直接利用同类技术构建自己的语音应用和智能体。
从技术路线来看,OpenAI希望GPT-Live-1解决的不只是“让AI能够说话”,而是让AI能够真正参与连续、实时、可打断的自然对话。通过将听、说、实时交互和深度推理进行拆分,OpenAI试图同时获得更低的语音延迟、更自然的对话体验以及更强的后台任务处理能力。
随着语音智能体逐渐从简单的语音问答转向电话客服、预约、语言教育、业务办理以及能够自主调用工具完成任务的复杂工作,实时语音模型的重要性也在不断提高。GPT-Live-1此次开放API,意味着开发者现在可以直接将ChatGPT目前使用的这一代实时语音技术嵌入自己的产品,而每分钟0.05美元的语音层价格,也让这种能力正式进入商业化应用阶段。

