本字幕由TME AI技术生成
大家好
这里是最佳拍档
我是大飞
北京时间八月八日的凌晨一点
欧派召开了最新的发布会
Gbt 五总算在万众期待中姗姗而至
此时呢
距离gbt 四的发布已经过去了两年半
不过呢
这一次比起chat gbt 的惊艳亮相
Gbt 四的跨越式升级
O 一发布式的震撼全场
这场发布会显得格外的平淡
不太惊艳的benchmark 丝毫没有新范式的影子
很难激起大家的兴趣
这示的用力也看不出与竞品的区别
甚至还有被网友抓包的ppt 展示错误
共同构成了这一小时二十分钟的发布会
但是呢
这并不意味着gbt 五没有进步
极低的幻觉率
前端能力的加强
上下文能力的跃升和极为有竞争力的价格
算得上是这次发布会难得的亮点
尤其是价格方面
在gbt 五出色的编程表现之下
Api 的价格即为ann orropicc 刚刚发布的cloud operers 四点一的十五分之一
也比二点五pro 的价格要低
这可以说是对anthropic 的致命一击
联想来说
欧en i 呢
虽然在和其他厂商的肉搏战中站稳了脚跟
但是呢
也已经失去了魔法的节奏
今天呢
我们就来回顾一下这场发布会的内容
看看gbt 五究竟都给我们带来了什么
本次发布的gbt 五呢
一共有四个版本
分别为gbt 五
Gbt 五mini
Gbt 五nano
以及只对企业版和每月两百美元高级版开放的gbt 五pro 模式
对于一般的用户来说呢
默认的是统一的模型gbt 五
它是一个由多个模型组成的系统
包括用来回答大多数问题的智能且快速的模型
也就是gbt 五may
以及用来解决更复杂问题的更深层次的推理模型gbt 五thinking
这种统一的实现是由一个实时的路由器来决定针对于特定的查询去使用哪个模型的
Gbt 五mini 和nano 呢
则是api 用户可选
而gbt 五pro 模式则类似于croks 的hard 模式
使使用在并行测试计算
一次呢
让多个模型一起并行计算更长时间
它相当于用更大的算例提供了最全面最精准的答案
因此呢
在超高难度的科学问题gpqv 上上
它新了世世界纪录
同时呢
在与人类专家的盲测中
实测里有近七次被认为更优
在能力和平分上
Gbt 五几乎在每一项上都有所提升
但是都只比当下的sta 高了那么一点点
也只比o 三强的十分有限
在这里水平方面的各种主流评测
吉利
Gbt 五虽然都高于o 三的水平
但是整体差距没有非常大
仔细看下来呢
在其中提升最为明显的前沿数学测试吉利
我们能够看到gbt 五的效果还不如拆了gbt agent
只有使用pro 模式下才会更强
当与其他模型做比较的时候
我们就能够发现
Gbt 五大多时候的智力能力仅仅稍微高出竞争对手一点点
部分能力呢
甚至还达不到扫塔
只能说整体以微小的幅度领先
这个呢
显然很难说是什么跨越式的能力提升
综合来看
根据art ficial analysis 的排名
Gbt 五目前领先第一
但是综合得分仅比o 三高了两分
比glok 四仅高了一分
这个个显示ggbt 五能力不及预的的是
Ark price 预测
在这个号称是g 的的中测试中
Gbt 五不d grock 四
而且是远远落后
这引得马斯克都激动的发推文
而且最近grorock 在ai 国际象棋大赛上披荆斩棘
这次呢
又压了open i 一头
感觉这个发布会过后
Grorock 反而可能是获利最大的那个
不过呢
从这里边我们也能够看到
相对于o 三
Gbt 五在计算效率上确实有所提高
能够以更少的token 消耗获得超过o 三的效果
它的效率呢
也领先于atsobic 的模型
根据open i 的介绍
Gvt 五thinking 在解决复杂问题的时候
使用的token 数量减少了百分之五十到百分之八十
不过呢
在用户体验上
Gpt 五呢
算是扳回了一程
在rm arena 这个主要由用户双盲测试来比较不同模型优劣的排行榜上
Gpt 五在所有项目上都得到了第一名
而在这次open i 着重强调的编程领域
Gpt 五在thinking 模式下也叫前代有着比较明显的提升
但是同样
如果把一直强调编程的竞争对手ann obcc 的最新的cloud office 四点一也算进来
优势呢
又极其微小了
两者呢
仅有百分之零点三的分差
虽然在整体编程基准上
Gbt 五的表现呢
并不是特别的突出
但是open i 呢
确实在编程的实际体验上做出了很多优化
在发布会上
Open i 重点介绍了编程的几个重要的提升
主要呢
体现在对编程要求的理解
对错误的改正能力和更多工具的使用能力上
这主要呢
是归功于auentic coding 系统的成熟
Gbt 五呢
擅长处理auentic 式的编码任务
可以调用多种工具连续工作几分钟甚至更长的时间来完成一个复杂的指令
嗯
模型在编码的时候甚至会主动沟通
解释他的计划
步骤和发现
就像是一个协作的团队一样行动
为了实现这种类似于协作伙伴的行为
Oi 的团队专门针对几个特性对模型进行了微调
提升了包括自主性
协作与沟通以及测试等方面的能力
应该说
编程要求的理解和指令遵循上的提升
让gbt 五能够将模糊或者是详细的指令转化为实际可用的代码
帮助即使不懂编程的人也能够实现他们的想法
而工具的调用能力在经过opi 的特别微调之后也凸显了出来
这一点呢
在套这个测试集中表现的非常明显
这是一个用来评估ai 模型在模拟真实世界场景中与用户进行动态对话
并且有效使用外部工具
比如说api 或者是函数调用来完成任务能力的测试集
可以看出
在电信领域
Gbt 五的能力提升是比较明显的
另一个非常重要的更新是修复bug 的能力大幅提升
在发布会的演示中
Gbt 五能够深入一个真实的代码库
通过搜索和读取文件来理解代码的结构和逻辑
并且最终定位到问题的根源
它甚至能够理解人类工程师做出某些架构决策的深层原因
比如说这是为了加强代码的安全性
而且呢
它还可以自动修复自己的bug
在演示一个前端应用的开发任务时候
Gpt 五在编写完代码之后
会自己尝试构建项目
当构建过程中出现错误的时候
他能够将这些错误信息反馈给自己
然后基于这些错误来修改和迭代自己的代码
这被opp i 的演示人员描述为一个深刻的时刻和一个自我改进的循环
在修复特定bug 的过程中
模型呢
也表现出了很高的智能
比如说它在运行代码检查link 的时候
发现了一些其他的问题
但是呢
它能够判断出这些问题与当前要修复的bug 无关
因此呢
暂时不会进行不必要的修改
这一点呢
对于当下的部wecoding 来说其实十分重要
因为在今年的一篇论文中
就曾经提到过一个反直觉的事实
那就是用ai 辅助编程反而可能会降低工作的效率而非提升
这其中呢
最主要的原因就是日常程序员所面对的往往并不是一个全新的项目
而是要在一堆旧的代码上去进行迭代
因此呢
如果没有对于复杂程序的整体把握
以及对自我bug 的修复功能的话
Ai 编程在这类项目上的能力可能就会大打折扣
也由此可见
这次呢
Open i 真的是在编程上花了很多的心思
针对于行业痛点做了大幅的调整和升级
沃顿商学院的教授伊森
Molik 在自己的测试中也体验到了gpt 五编程给人带来的省心的特点
Gpt 五呢
在编程上的另一个提升点就是前端方面的能力
在现场展示中
欧派的研究员让gpt 五现场生成了一系列的内容
包括飞机的空气动力学动态展示
这个内容呢
足足有四百行代码
Gpt 五呢
写了两分钟
还有一个教语法的贪吃蛇游戏
整体表现呢
也都很不错
不过呢
之前在各种泄露中被广泛认为会大幅提升的多模态能力
Gbt 五的提升并不太明显
而且呢
与g 米奶这种大一统模型不同
Gbt 五呢
仍然是一个主要进行文字和图像理解的模型
当下呢
它仍然不支持音频的输入输出和图像生成
视频呢就更别说了
想短期内追上谷歌刚刚发布的ge 三
看起来对open 来说还是难度太大了
虽然gbt 五的综合实力呢
并不惊艳
只能说勉强保住了第一的位置
但是在一些小的方面
Gbt 五的提升确实可圈可点
而且呢
这些小的方面也许能起到一些重要的决定性作用
首先呢
是幻觉和安全
Gpt 五呢
显著减少了幻觉的发生
它出现事实错误的概率比gpt 四o 低大约百分之四十五
比open io 三低大约百分之八十
这个应该说呢
是一个相当了不起的成就
不到百分之一的幻觉率
这对于实际落地应用来说无疑是极其重要的
尤其是在工业环境以及实际的工作环境中
幻觉是一个致命的问题
所以呢
也难怪open i 的核心人员诺姆
布朗把针对于发布会的唯一评论献给了gbt 五在消除幻觉上的进步
欧y 呢
还在gbt 五的系统卡中简要的提到了他们使用的大概方法
他们呢
一方面强化了训练模型
让它能够有效的使用浏览工具来获取最新的信息
另一方面呢
当模型不使用浏览工具
而是依赖于自身的内部知识的时候
训练的重点则放在了减少在这种情况下产生的幻觉
嗯
更底层的原因可能是gpt 五thinking 经历的强化学习训练
在这些训练里
Open i 似乎利用了一些最新的训练方法
让这些模型学会了如何去完善自己的思考过程
尝试不同的策略
并且认识到自己的错误
也正是因为这个训练模式
Gpt 五模型的欺骗行为也大幅的减少
在部分维度上居然可以减少将近百分之九十
这可能也和幻觉的下降有直接的关系
Gpt 五呢
另一个非常重要的进步就是上下文能力
首先呢
所有gbt 五版本目前支持的上下文呢
都扩展到了四百k
远超o 三四o 的一百二十八k 的默认上下文长度
虽然呢
还赶不上金米奶一兆的上下文
但是相比于其他对手
也已经算是领先一步了
而且呢
从测试上来看
上下文的精准度提升堪称飞跃
在大海捞针测试里
Gbt 五的准确率比o 三提升了将近一倍
这意味着gbt 五处理长文本的能力会有比较明显的强化
这对于像编程
写作
分析等等复杂的任务来说
影响会较大
应该说呢
这两个不大的特点虽然不能够提升gbt 五的综合智力
但是可能会给gbt 五带来类似于护城河式的优秀体验
如果说在能力项上
我们还是可以在编程和幻觉上找到些许的亮点
那gbt 五的新功能基本上呢
只能说是食之无味了
首先呢
是写作上的优化
欧pi 在演示中表示
与之前的模型相比
Gbt 五在写作质量上有着明显的提升
能够更好的帮助用户润色草稿
邮件和故事
最重要的是
Gbt 五更有人味
Ai 味更少
它生成的回复更有节奏感和韵律感
语言呢
更加真诚
更能够引起人们的情感共鸣
而且因为整体能力的提升
它能够更好的理解情境之间的细微差别
让ai 的回应感觉不那么像ai
但是呢
在演示过程中
这个感觉其实很不直观
就像前两天奥特曼秀出gpt 五推荐的电影的时候
大家其实也看不太出来这和gpt 四o 有什么大的区别
不后呢
是语音功能
Gpt 五的声音号称听起来极其的自然
就像是和真人在对话一样
它还新增了视频的输入功能
可以让语音助手看到你所看到的东西
不过呢
这现在已经基本上属于标配了
甚至现场感觉起来
还是glock 四的超高语音回应速度更加让人印象深刻
在记忆能力的升级方面
虽然open i 在发布会上提到了对记忆功能进行了大量的增强
但是实际演示来看
只是推出了与gmail 和google calendar 的集成功能
允许拆掉gbt 访问用户的邮件和日历来帮助规划日程
怎么说呢
这其实也是一种标配的水平
而且呢
和记忆功能的关联性其实并不强
最后呢
是个性化的功能
现在呢
Gbt 五允许用户自定义聊天界面的颜色了
这个呢
不禁会让人想到
当一个所谓前沿的技术公司开始整这些花活的时候
也许只能够说明它真的没有什么别的可以展示给大家了
在之前呢
Information 的爆料中
Gbt 五呢
开发失速的主要原因之一就是数据瓶颈
对此呢
Opi 发布会上也给出了一个解释
那就是在gbt 五的训练中
Opi 尝试了新的训练技术
让模型可以利用前一代模型创造的数据
与填充类型的数据不同
Opi 呢
专注生成的是正确类型的数据
目的呢
在于教导模型
他们利用自己的模型打造了一个高品质的合成流程
生成了可以用来教导gbt 五的复杂数据
而且呢
他们这种跨代模型间的互动
试着一个递归式的改进循环
及前一代的模型可以越来越多的帮助改进和生成下一代模型的训练数据
这也许就是在o 一模型推出的时候
大家一直猜想的由推理模型产生高质量数据
让预训练模型越来越强
在由此通过强化学习来加强下一代推理模型的所谓左脚踩右脚式的训练方法
没想到这次还真的被open i 给证实了
不过呢
从效果上来看
这个方法的saling 并不是那么的有效
所以数据的困境还没有被完全的解决
如果说gbt 五的性能提升不尽如人意
不过呢
至少在价格上
它做到了皆大欢喜
首先呢
是对c 端用户来说
免费用户也可以使用gbt 五了
但是呢
有使用的次数限制
当然这个限额呢
也相当的慷慨
每天呢
可以聊几个小时
当达到上限之后
会自动切换到gbt 五迷你模型
而对于plus 用户
将拥有比免费用户高得多的使用额度
基本上呢
可以满足日常的应用
而对于api 用户来讲
Gbt 五几乎给出了一个难以拒绝的价格
每百万输入token 一点二五美元
输出十美元
这个价格呢
比gbt 四o 还要便宜
甚至比一直以低价著称的gm 点二点五pro 都更便宜
而mini 和nano 的价格也都低于主要竞争对手的同等级模型
如果gbt 五的编程能力确实像测试的那样强大
那对于价格高出十五倍的anthorpic 而言
将是毁灭性的打击
不过呢
谁能够想到一个一直号称以技术领先为核心定义的公司
居然开始打起价格战了
我觉得呢
这是open ig 这次发布会上实际上最大的亮点
不过呢
也可能是最大的惋惜之处
当先行者变得务时
也许将预示着这一波技术浪潮将进入阶段性的尾声
比起gbt 五的平民表现来说
这场长达一小时二十分的发布会更是可以堪称一场灾难
首先呢
是发布会上的图表欺诈
发布会刚开始没多久
眼尖的网友们就在发布会展示的ppt 里面发现swe benchmark 数据被以不成比例的方式展示来凸显gbt 五的提升
这里的比例完全错误
很快呢
网友们就还原了一个真实的比例
而且这样的错误呢
还不止一处
在totwo benchmark 的展示中
同样出现了百分之五十五比百分之五十八点一大的情况
针对这些致命的错误
很快网友们就开始了嘲讽的狂欢
比如说拿gbt 序号来建表讽刺open i 的表格魔法
对于已经经历过mo 金牌风波
深陷在炒作大师印象中的open i 来说
这种错误可以说更是火上浇油
坐实了他们善于炒作不可信的形象
除此之外
整场演示过程
我个人认为只有最后用集成gbt 五的curs 生成的城堡小游戏稍微比较亮眼以外
其他的所有展示都过于冗长和专业
而且效果平平
对比anthorvic 让cloud 运营自动售货机的实验
米ji 展示agent 性能的宝可梦通关这些更具有冲击力
更能够展示前沿探索的发布会环节来说
实在是缺乏看点
而且呢
发布会期间充斥着很多无聊的冷笑话
漫长的推理等待时间更是让发布会的沉闷达到了一种前所未有的水平
如果说奥特曼是一个营销大师
那这场发布会无疑也让这个名头翻了车
也许呢
也正是因为奥特曼在会前给出的gpt 五比我都强的超高期待
和发布会时的评淡表现形成了强烈的反差
再加上错误连连的问题
让这次open i 明显被舆论反噬
根据polly market 的调查
发布会后大家对于open i 的模型能力评价可以说是一路下失
对于整个ai 产业来说
这次发布会可能给未来笼罩了一层阴影
从gbt 四点五项目的失败
我们已经看到了参数规模scheing law 逐渐放缓的迹象
而用了十倍算力堆砌强化学习的glock 四尽管在某些测试中表现亮眼
但是整体上也没有展现出革命性的跨越
这暗示着test time computer 的scheen law 也似乎开始鉴定
到今天gbt 五小步前进式的进步
不知道是否也在说低垂的果实已经摘完了
接踵而至的是内堵看不见的ai 快速增长之强
这也许更加意味着我们需要从那个指数级增长的狂欢中清醒过来
迎接一个更加务实
竞争更加激烈的新阶段
可能ai 行业真的需要一个新的
大的突破
才能够重回如梦幻般的一代
一个大跨越的节奏中去
但是这个突破何时到来
以何种形式到来
已经变得难以预测
我们现在能够确定的只是
Gpt 五肯定还远远不是agi
那大家是如何看待gpt 五的呢
欢迎在评论区留言
感谢大家的观看
我们下期再见