复制成功

分享至

主页 > 数字货币 >

OpenAI放了一个大招,这才是真正的语音助手

2024.05.16

在过去的几年里,我们一直非常专注于提高这些模型的智能......但这是我们第一次在易用性方面真正迈出一大步。

继文生视频模型Sora之后,OpenAI再一次给外界带来惊喜。这一次,OpenAI向世人展现了强大且丝滑的语音对话等多模态能力。

北京时间5月14日凌晨1点,在谷歌开发者大会前一天,预热已久的OpenAI正式向公众发布了语音大模型GPT-4o(omnimodle,全能模型),可以综合利用语音、文本和视觉信息进行推理,扮演一个个人语音交互助手。而且,OpenAI将会对这一模型免费向公众开放。

除了全新的大模型,OpenAI也正式宣布推出ChatGPT桌面版,“从今天开始,我们将首先向Plus用户推出macOS应用,并在未来几周内向更广泛的用户开放。我们还计划在今年晚些时候推出Windows版本。”

01 情感化、对话丝滑,效果令人震撼

发布会全程只持续了26分钟,OpenAI CEO奥特曼没有现身,由公司CTO和两位工程师来发布。它的界面是一个巨大的黑点,但现场演示的几个GPT4o对话场景却令人感到惊艳。

整个对话的过程非常丝滑,不仅能说能听能看,还会有情绪的变化,就像是和一个真实的人在打视频电话。

而通过OpenAI现场演示的几个场景,我们也仿佛看到了《Her》的场面,科幻正在成为现实。 场景一:缓解情绪

演示嘉宾说自己现在有点紧张要如何缓解,大模型立马安抚他别紧张,慢下来,可以深呼吸。然后演示嘉宾故意做出非常夸张且急促的呼吸声。大模型很快纠正了这种不正确的呼吸方式,在它的指导下如何缓慢地呼气和吸气。 场景二:讲睡前故事

要求大模型讲一个关于机器人与爱的睡前故事。正当大模型讲得正起劲时,主持人赶紧打断,提出声音要更有感情,大模型很快切换到了非常有戏剧性的声音。结果话还没说完,一位嘉宾接过话题,提出声音需要更有冲击力,大模型便以一种非常夸张的口吻继续讲述着刚才的睡前故事。但是,对大模型的考验还没有结束,另一位嘉宾又提出要切换到机器人的声音。很快,大模型就开始模仿机器人的腔调继续讲述。最终,大模型被要求以演唱一首歌结束了对话。 场景三:解代数方程

演示嘉宾在纸上写了一个简单的方程式,要求语音助手通过摄像头获得视觉能力后,实时视频指导数学解题。

大模型刚开始还出现了“幻觉”,在没打开摄像头时就自信满满地说理解了。当演示嘉宾提示后,她才说“oops,我太兴奋了。”然后大模型一步一步提醒和讲解他的解题思路。整个过程,大模型就像一个很有经验且富有耐心的数学老师。

妈妈再也不用担心我的学习了。

OpenAI放了一个大招,这才是真正的语音助手

场景四:根据外表判断情绪

演示嘉宾拿着手机摄像头对着自己的脸和大模型对话,大模型很快通过识别视频中的人物表情给出了自己的判断。大模型说,你看起来很开心,带着灿烂的笑容,甚至有一丝兴奋,你能分享你快乐的来源吗?当演示嘉宾说,开心是因为要展示你多么有用和强大时,大模型甚至表现出了一丝丝的娇羞。

在这个场景的演示中还出现了一个插曲,演示嘉宾一开始打开的是后置摄像头,拍到的是一张桌子,大模型说“这看起来像是一个木板的表面”。演示嘉宾很快说自己拍错了画面,然后转换成前置摄像头开始自拍,大模型也快速反应过来。

OpenAI放了一个大招,这才是真正的语音助手

总结一下OpenAI语音大模型在演示中的几个特点:

一是快,快速反应,几乎没有时延,而且语速跟正常人没有差别,仿佛在跟一个真实的人类在打电话。而此前,用户使用语音功能与ChatGPT对话时,GPT-3.5的平均延迟为2.8秒,GPT-4为5.4秒。

二是可以随时打断,不用等它回答完,直接打断,也能快速接着最新的话题往下聊,非常丝滑;

三是可以捕捉情绪变化,比如能判断对方急促的呼吸方式不对。而且也可以扮演不同的角色,比如戏剧性的语气,或者冰冷的机器人的声音,切换自如。

四是多模态的能力很强,比如你可以用意大利语提问,然后要求对方用英语回答,比如可以写一个方程式,语音助手可以通过手机摄像头识别后,一步步教你解题步骤。甚至还可以用摄像头对着自己,语音助手可以识别图像来判断你现在的情绪。从“软件代码中发生了什么?”到“这个人穿什么牌子的衬衫?”,大模型都能通过多模态的能力,很好地回答。

免责声明:数字资产交易涉及重大风险,本资料不应作为投资决策依据,亦不应被解释为从事投资交易的建议。请确保充分了解所涉及的风险并谨慎投资。OKEx学院仅提供信息参考,不构成任何投资建议,用户一切投资行为与本站无关。

加⼊OKEx全球社群

和全球数字资产投资者交流讨论

扫码加入OKEx社群

相关推荐

industry-frontier