GPT-5发布 | 准备两年半却令人失望 | 价格屠夫 | 未见跨越式提升-AI前沿

GPT-5发布 | 准备两年半却令人失望 | 价格屠夫 | 未见跨越式提升

歌手:AI前沿

专辑:AI前沿

时间:2024-12-28

    使用手机浏览器「扫一扫」

    在手机上保存,获得更好体验

标签
歌词

本字幕由TME AI技术生成

大家好

这里是最佳拍档

我是大飞

北京时间八月八日的凌晨一点

欧派召开了最新的发布会

Gbt 五总算在万众期待中姗姗而至

此时呢

距离gbt 四的发布已经过去了两年半

不过呢

这一次比起chat gbt 的惊艳亮相

Gbt 四的跨越式升级

O 一发布式的震撼全场

这场发布会显得格外的平淡

不太惊艳的benchmark 丝毫没有新范式的影子

很难激起大家的兴趣

这示的用力也看不出与竞品的区别

甚至还有被网友抓包的ppt 展示错误

共同构成了这一小时二十分钟的发布会

但是呢

这并不意味着gbt 五没有进步

极低的幻觉率

前端能力的加强

上下文能力的跃升和极为有竞争力的价格

算得上是这次发布会难得的亮点

尤其是价格方面

在gbt 五出色的编程表现之下

Api 的价格即为ann orropicc 刚刚发布的cloud operers 四点一的十五分之一

也比二点五pro 的价格要低

这可以说是对anthropic 的致命一击

联想来说

欧en i 呢

虽然在和其他厂商的肉搏战中站稳了脚跟

但是呢

也已经失去了魔法的节奏

今天呢

我们就来回顾一下这场发布会的内容

看看gbt 五究竟都给我们带来了什么

本次发布的gbt 五呢

一共有四个版本

分别为gbt 五

Gbt 五mini

Gbt 五nano

以及只对企业版和每月两百美元高级版开放的gbt 五pro 模式

对于一般的用户来说呢

默认的是统一的模型gbt 五

它是一个由多个模型组成的系统

包括用来回答大多数问题的智能且快速的模型

也就是gbt 五may

以及用来解决更复杂问题的更深层次的推理模型gbt 五thinking

这种统一的实现是由一个实时的路由器来决定针对于特定的查询去使用哪个模型的

Gbt 五mini 和nano 呢

则是api 用户可选

而gbt 五pro 模式则类似于croks 的hard 模式

使使用在并行测试计算

一次呢

让多个模型一起并行计算更长时间

它相当于用更大的算例提供了最全面最精准的答案

因此呢

在超高难度的科学问题gpqv 上上

它新了世世界纪录

同时呢

在与人类专家的盲测中

实测里有近七次被认为更优

在能力和平分上

Gbt 五几乎在每一项上都有所提升

但是都只比当下的sta 高了那么一点点

也只比o 三强的十分有限

在这里水平方面的各种主流评测

吉利

Gbt 五虽然都高于o 三的水平

但是整体差距没有非常大

仔细看下来呢

在其中提升最为明显的前沿数学测试吉利

我们能够看到gbt 五的效果还不如拆了gbt agent

只有使用pro 模式下才会更强

当与其他模型做比较的时候

我们就能够发现

Gbt 五大多时候的智力能力仅仅稍微高出竞争对手一点点

部分能力呢

甚至还达不到扫塔

只能说整体以微小的幅度领先

这个呢

显然很难说是什么跨越式的能力提升

综合来看

根据art ficial analysis 的排名

Gbt 五目前领先第一

但是综合得分仅比o 三高了两分

比glok 四仅高了一分

这个个显示ggbt 五能力不及预的的是

Ark price 预测

在这个号称是g 的的中测试中

Gbt 五不d grock 四

而且是远远落后

这引得马斯克都激动的发推文

而且最近grorock 在ai 国际象棋大赛上披荆斩棘

这次呢

又压了open i 一头

感觉这个发布会过后

Grorock 反而可能是获利最大的那个

不过呢

从这里边我们也能够看到

相对于o 三

Gbt 五在计算效率上确实有所提高

能够以更少的token 消耗获得超过o 三的效果

它的效率呢

也领先于atsobic 的模型

根据open i 的介绍

Gvt 五thinking 在解决复杂问题的时候

使用的token 数量减少了百分之五十到百分之八十

不过呢

在用户体验上

Gpt 五呢

算是扳回了一程

在rm arena 这个主要由用户双盲测试来比较不同模型优劣的排行榜上

Gpt 五在所有项目上都得到了第一名

而在这次open i 着重强调的编程领域

Gpt 五在thinking 模式下也叫前代有着比较明显的提升

但是同样

如果把一直强调编程的竞争对手ann obcc 的最新的cloud office 四点一也算进来

优势呢

又极其微小了

两者呢

仅有百分之零点三的分差

虽然在整体编程基准上

Gbt 五的表现呢

并不是特别的突出

但是open i 呢

确实在编程的实际体验上做出了很多优化

在发布会上

Open i 重点介绍了编程的几个重要的提升

主要呢

体现在对编程要求的理解

对错误的改正能力和更多工具的使用能力上

这主要呢

是归功于auentic coding 系统的成熟

Gbt 五呢

擅长处理auentic 式的编码任务

可以调用多种工具连续工作几分钟甚至更长的时间来完成一个复杂的指令

模型在编码的时候甚至会主动沟通

解释他的计划

步骤和发现

就像是一个协作的团队一样行动

为了实现这种类似于协作伙伴的行为

Oi 的团队专门针对几个特性对模型进行了微调

提升了包括自主性

协作与沟通以及测试等方面的能力

应该说

编程要求的理解和指令遵循上的提升

让gbt 五能够将模糊或者是详细的指令转化为实际可用的代码

帮助即使不懂编程的人也能够实现他们的想法

而工具的调用能力在经过opi 的特别微调之后也凸显了出来

这一点呢

在套这个测试集中表现的非常明显

这是一个用来评估ai 模型在模拟真实世界场景中与用户进行动态对话

并且有效使用外部工具

比如说api 或者是函数调用来完成任务能力的测试集

可以看出

在电信领域

Gbt 五的能力提升是比较明显的

另一个非常重要的更新是修复bug 的能力大幅提升

在发布会的演示中

Gbt 五能够深入一个真实的代码库

通过搜索和读取文件来理解代码的结构和逻辑

并且最终定位到问题的根源

它甚至能够理解人类工程师做出某些架构决策的深层原因

比如说这是为了加强代码的安全性

而且呢

它还可以自动修复自己的bug

在演示一个前端应用的开发任务时候

Gpt 五在编写完代码之后

会自己尝试构建项目

当构建过程中出现错误的时候

他能够将这些错误信息反馈给自己

然后基于这些错误来修改和迭代自己的代码

这被opp i 的演示人员描述为一个深刻的时刻和一个自我改进的循环

在修复特定bug 的过程中

模型呢

也表现出了很高的智能

比如说它在运行代码检查link 的时候

发现了一些其他的问题

但是呢

它能够判断出这些问题与当前要修复的bug 无关

因此呢

暂时不会进行不必要的修改

这一点呢

对于当下的部wecoding 来说其实十分重要

因为在今年的一篇论文中

就曾经提到过一个反直觉的事实

那就是用ai 辅助编程反而可能会降低工作的效率而非提升

这其中呢

最主要的原因就是日常程序员所面对的往往并不是一个全新的项目

而是要在一堆旧的代码上去进行迭代

因此呢

如果没有对于复杂程序的整体把握

以及对自我bug 的修复功能的话

Ai 编程在这类项目上的能力可能就会大打折扣

也由此可见

这次呢

Open i 真的是在编程上花了很多的心思

针对于行业痛点做了大幅的调整和升级

沃顿商学院的教授伊森

Molik 在自己的测试中也体验到了gpt 五编程给人带来的省心的特点

Gpt 五呢

在编程上的另一个提升点就是前端方面的能力

在现场展示中

欧派的研究员让gpt 五现场生成了一系列的内容

包括飞机的空气动力学动态展示

这个内容呢

足足有四百行代码

Gpt 五呢

写了两分钟

还有一个教语法的贪吃蛇游戏

整体表现呢

也都很不错

不过呢

之前在各种泄露中被广泛认为会大幅提升的多模态能力

Gbt 五的提升并不太明显

而且呢

与g 米奶这种大一统模型不同

Gbt 五呢

仍然是一个主要进行文字和图像理解的模型

当下呢

它仍然不支持音频的输入输出和图像生成

视频呢就更别说了

想短期内追上谷歌刚刚发布的ge 三

看起来对open 来说还是难度太大了

虽然gbt 五的综合实力呢

并不惊艳

只能说勉强保住了第一的位置

但是在一些小的方面

Gbt 五的提升确实可圈可点

而且呢

这些小的方面也许能起到一些重要的决定性作用

首先呢

是幻觉和安全

Gpt 五呢

显著减少了幻觉的发生

它出现事实错误的概率比gpt 四o 低大约百分之四十五

比open io 三低大约百分之八十

这个应该说呢

是一个相当了不起的成就

不到百分之一的幻觉率

这对于实际落地应用来说无疑是极其重要的

尤其是在工业环境以及实际的工作环境中

幻觉是一个致命的问题

所以呢

也难怪open i 的核心人员诺姆

布朗把针对于发布会的唯一评论献给了gbt 五在消除幻觉上的进步

欧y 呢

还在gbt 五的系统卡中简要的提到了他们使用的大概方法

他们呢

一方面强化了训练模型

让它能够有效的使用浏览工具来获取最新的信息

另一方面呢

当模型不使用浏览工具

而是依赖于自身的内部知识的时候

训练的重点则放在了减少在这种情况下产生的幻觉

更底层的原因可能是gpt 五thinking 经历的强化学习训练

在这些训练里

Open i 似乎利用了一些最新的训练方法

让这些模型学会了如何去完善自己的思考过程

尝试不同的策略

并且认识到自己的错误

也正是因为这个训练模式

Gpt 五模型的欺骗行为也大幅的减少

在部分维度上居然可以减少将近百分之九十

这可能也和幻觉的下降有直接的关系

Gpt 五呢

另一个非常重要的进步就是上下文能力

首先呢

所有gbt 五版本目前支持的上下文呢

都扩展到了四百k

远超o 三四o 的一百二十八k 的默认上下文长度

虽然呢

还赶不上金米奶一兆的上下文

但是相比于其他对手

也已经算是领先一步了

而且呢

从测试上来看

上下文的精准度提升堪称飞跃

在大海捞针测试里

Gbt 五的准确率比o 三提升了将近一倍

这意味着gbt 五处理长文本的能力会有比较明显的强化

这对于像编程

写作

分析等等复杂的任务来说

影响会较大

应该说呢

这两个不大的特点虽然不能够提升gbt 五的综合智力

但是可能会给gbt 五带来类似于护城河式的优秀体验

如果说在能力项上

我们还是可以在编程和幻觉上找到些许的亮点

那gbt 五的新功能基本上呢

只能说是食之无味了

首先呢

是写作上的优化

欧pi 在演示中表示

与之前的模型相比

Gbt 五在写作质量上有着明显的提升

能够更好的帮助用户润色草稿

邮件和故事

最重要的是

Gbt 五更有人味

Ai 味更少

它生成的回复更有节奏感和韵律感

语言呢

更加真诚

更能够引起人们的情感共鸣

而且因为整体能力的提升

它能够更好的理解情境之间的细微差别

让ai 的回应感觉不那么像ai

但是呢

在演示过程中

这个感觉其实很不直观

就像前两天奥特曼秀出gpt 五推荐的电影的时候

大家其实也看不太出来这和gpt 四o 有什么大的区别

不后呢

是语音功能

Gpt 五的声音号称听起来极其的自然

就像是和真人在对话一样

它还新增了视频的输入功能

可以让语音助手看到你所看到的东西

不过呢

这现在已经基本上属于标配了

甚至现场感觉起来

还是glock 四的超高语音回应速度更加让人印象深刻

在记忆能力的升级方面

虽然open i 在发布会上提到了对记忆功能进行了大量的增强

但是实际演示来看

只是推出了与gmail 和google calendar 的集成功能

允许拆掉gbt 访问用户的邮件和日历来帮助规划日程

怎么说呢

这其实也是一种标配的水平

而且呢

和记忆功能的关联性其实并不强

最后呢

是个性化的功能

现在呢

Gbt 五允许用户自定义聊天界面的颜色了

这个呢

不禁会让人想到

当一个所谓前沿的技术公司开始整这些花活的时候

也许只能够说明它真的没有什么别的可以展示给大家了

在之前呢

Information 的爆料中

Gbt 五呢

开发失速的主要原因之一就是数据瓶颈

对此呢

Opi 发布会上也给出了一个解释

那就是在gbt 五的训练中

Opi 尝试了新的训练技术

让模型可以利用前一代模型创造的数据

与填充类型的数据不同

Opi 呢

专注生成的是正确类型的数据

目的呢

在于教导模型

他们利用自己的模型打造了一个高品质的合成流程

生成了可以用来教导gbt 五的复杂数据

而且呢

他们这种跨代模型间的互动

试着一个递归式的改进循环

及前一代的模型可以越来越多的帮助改进和生成下一代模型的训练数据

这也许就是在o 一模型推出的时候

大家一直猜想的由推理模型产生高质量数据

让预训练模型越来越强

在由此通过强化学习来加强下一代推理模型的所谓左脚踩右脚式的训练方法

没想到这次还真的被open i 给证实了

不过呢

从效果上来看

这个方法的saling 并不是那么的有效

所以数据的困境还没有被完全的解决

如果说gbt 五的性能提升不尽如人意

不过呢

至少在价格上

它做到了皆大欢喜

首先呢

是对c 端用户来说

免费用户也可以使用gbt 五了

但是呢

有使用的次数限制

当然这个限额呢

也相当的慷慨

每天呢

可以聊几个小时

当达到上限之后

会自动切换到gbt 五迷你模型

而对于plus 用户

将拥有比免费用户高得多的使用额度

基本上呢

可以满足日常的应用

而对于api 用户来讲

Gbt 五几乎给出了一个难以拒绝的价格

每百万输入token 一点二五美元

输出十美元

这个价格呢

比gbt 四o 还要便宜

甚至比一直以低价著称的gm 点二点五pro 都更便宜

而mini 和nano 的价格也都低于主要竞争对手的同等级模型

如果gbt 五的编程能力确实像测试的那样强大

那对于价格高出十五倍的anthorpic 而言

将是毁灭性的打击

不过呢

谁能够想到一个一直号称以技术领先为核心定义的公司

居然开始打起价格战了

我觉得呢

这是open ig 这次发布会上实际上最大的亮点

不过呢

也可能是最大的惋惜之处

当先行者变得务时

也许将预示着这一波技术浪潮将进入阶段性的尾声

比起gbt 五的平民表现来说

这场长达一小时二十分的发布会更是可以堪称一场灾难

首先呢

是发布会上的图表欺诈

发布会刚开始没多久

眼尖的网友们就在发布会展示的ppt 里面发现swe benchmark 数据被以不成比例的方式展示来凸显gbt 五的提升

这里的比例完全错误

很快呢

网友们就还原了一个真实的比例

而且这样的错误呢

还不止一处

在totwo benchmark 的展示中

同样出现了百分之五十五比百分之五十八点一大的情况

针对这些致命的错误

很快网友们就开始了嘲讽的狂欢

比如说拿gbt 序号来建表讽刺open i 的表格魔法

对于已经经历过mo 金牌风波

深陷在炒作大师印象中的open i 来说

这种错误可以说更是火上浇油

坐实了他们善于炒作不可信的形象

除此之外

整场演示过程

我个人认为只有最后用集成gbt 五的curs 生成的城堡小游戏稍微比较亮眼以外

其他的所有展示都过于冗长和专业

而且效果平平

对比anthorvic 让cloud 运营自动售货机的实验

米ji 展示agent 性能的宝可梦通关这些更具有冲击力

更能够展示前沿探索的发布会环节来说

实在是缺乏看点

而且呢

发布会期间充斥着很多无聊的冷笑话

漫长的推理等待时间更是让发布会的沉闷达到了一种前所未有的水平

如果说奥特曼是一个营销大师

那这场发布会无疑也让这个名头翻了车

也许呢

也正是因为奥特曼在会前给出的gpt 五比我都强的超高期待

和发布会时的评淡表现形成了强烈的反差

再加上错误连连的问题

让这次open i 明显被舆论反噬

根据polly market 的调查

发布会后大家对于open i 的模型能力评价可以说是一路下失

对于整个ai 产业来说

这次发布会可能给未来笼罩了一层阴影

从gbt 四点五项目的失败

我们已经看到了参数规模scheing law 逐渐放缓的迹象

而用了十倍算力堆砌强化学习的glock 四尽管在某些测试中表现亮眼

但是整体上也没有展现出革命性的跨越

这暗示着test time computer 的scheen law 也似乎开始鉴定

到今天gbt 五小步前进式的进步

不知道是否也在说低垂的果实已经摘完了

接踵而至的是内堵看不见的ai 快速增长之强

这也许更加意味着我们需要从那个指数级增长的狂欢中清醒过来

迎接一个更加务实

竞争更加激烈的新阶段

可能ai 行业真的需要一个新的

大的突破

才能够重回如梦幻般的一代

一个大跨越的节奏中去

但是这个突破何时到来

以何种形式到来

已经变得难以预测

我们现在能够确定的只是

Gpt 五肯定还远远不是agi

那大家是如何看待gpt 五的呢

欢迎在评论区留言

感谢大家的观看

我们下期再见

展开显示全部歌词