李飞飞联合领导的斯坦福大学HAI发布2025年AI指数报告|模型推理成本下降280倍-AI前沿

李飞飞联合领导的斯坦福大学HAI发布2025年AI指数报告|模型推理成本下降280倍

歌手:AI前沿

专辑:AI前沿

时间:2024-12-28

    使用手机浏览器「扫一扫」

    在手机上保存,获得更好体验

标签
歌词

本字幕由TME AI技术生成

大家好

这里是最佳拍档

我是大飞

四月七号

由李飞飞联合领导的斯坦福大学hai 研究所发布了最新的二零二五年人工智能指数报告

大概呢

不到一年前

我们曾经解读过长达五百页的二零二四年的报告

而今年的报告呢

也长达四百五十六页

不仅涵盖了研发技术

性能

负责任的人工智能

经济影响

科学和医学

政策

教育和公众舆论等等主题的图表和数据海

新增了对ai 硬发展状况的深入分析

对推理成本的新的估算

以及对于ai 出版和专利申请趋势的分析

Hai 呢

在自己的官网上也写到

这是我们迄今为止发布的最全面的版本

人工智能对于社会的影响从来没有如此的明显

他们还认为ai 将成为二十一世纪最具有变革性的技术

不过呢

除非我们精心的引导ai 行业的发展

否则这项技术将难以惠及普罗大众

那么这份报告究竟都说了什么呢

又为什么表达了这样的单一呢

今天大飞就来为大家解读一下

看看这一年间

Ai 究竟都发生了哪些变化

为了节省大家的时间

我将主要介绍报告的十二个核心要点

完整的报告内容

建议大家有时间还是阅读原文

首先第一点

Ai 在苛刻基准上的表现持续的提升

二零二三年

研究人员引入了一些新的基准

包括如今大家熟悉的mmmugpqa 和swe bunch

用来测试前沿ai 模型的性能极限

然而仅仅一年之后

模型的性能就大幅提升

在mmmugpqa 和swe bunch 上的得分分别提高了十八点八

四十八点九和六十七点三个百分点

在swe bunch 编程测试中

Ai 系统在二零二三年只能解决百分之四点四的问题

但是到了二零二四年

这个数字猛增到了惊人的百分之七十一点七

在基准测试之外

Ai 系统在生成高质量视频方面也取得了重大的进展

包括open i 的sorver

Stable diffusion 的三d 四d

Meate 的mobe g

以及谷歌demine 的view two

在某些场景下

基于大元模型的agent 甚至在短时间任务上会超越人类

比如说在二零二四年推出的re 半尺的测试平台

在两小时内的短期任务中

顶尖ai 系统的表现是人类专家的四倍

但是随着任务持续时间延长到三十二小时

人类专家的表现反而会超过ai 两倍

不过呢

在像编写trade 内核这种编程任务上

Ai agent 的表现已经能够匹敌人类专家

而且更快

成本更低

第二点

Ai 正在越来越多的融入到人们的日常生活中

从医疗保健到交通运输

如今我们可以看到

Ai 正在迅速的从实验室走向日常生活

在医疗方面

二零二三年

Fda 批准了二百二十三种ai 医疗设备

而二零一五年仅为六种

在交通方面

美国最大的自动驾驶运营商vivo 每周提供了超过十五万次的自动驾驶出行

而百度的罗布快跑自动驾驶出租车现在呢

也已经在中国多个城市提供服务

第三点

企业全力的投入ai

推动投资和使用创历史新高

二零二四年

全球企业对于ai 的投资达到了创纪录的两千五百二十三亿美元

其中私人投资增幅高达百分之四十四点五

企业并购活动则增长了百分之十二点一

过去十年

这个领域呈现出了爆发式的增长

投资总额相比于二零一四年增长了超过十三倍

其中生成式ai 尤其的强劲

其球吸引的私营投资总共为三百三十九亿美元

比二零二三年增长了百之十八点七

美国呢

也正在进一步的巩固在全球ai 私人投资中的领先地位

二零二四年

仅美国私人ai 投资就增长到了一千零九十亿美元

这几乎是中国总投资九十三亿美元的十二倍

是英国总投资四十五亿美元的二十四倍

而在生成式ai 领域

美国的投资额超过了中国

欧盟和英国之和的二百五十四亿美元

也远远高于二零二三年的二百一十八亿美元

Ai 的商业应用也在加速

二零二四年

百分之七十八的组织报告称有在使用ai

比前年的百分之五十五增长了百分之二十三

尤其是在生成式ai 方面

从二零二三年的百分之三十三迅速增长到了去年的百分之七十一

同时呢

越来越多的研究证实ai 提高了生产力

并且在大多数的情况下有助于缩小劳动力中的技能差距

第四点

在创造顶级ai 模型方面

中国正在缩小与美国的差距

明零二四年

美国机构总共推出了四十个引人注目的ai 模型

明显超过了中国的十五个和欧洲的三个

虽然美国在数量上保持领先

但是中国模型在质量上迅速缩小了差距

比如说在mmlummmu mass 和human evil 等主要基准上的性能差异

从二零二三年的十七点五

十三点五

二十四点三和三十一点六个百分点

缩小到了二零二四年底的零点三

八点一

一点六和三点七个百分点

同时

中国在ai 出版物和专利方面继续领先

与此同时

模型的开发也越来越全球化

中东

拉丁美洲和东南亚等地区也推出了引人注目的新模型

第五点

负责任的ai 生态系统在不断的发展

但是处于不均衡的状态

人工智能的相关事件急剧的上升

二零二四年报告的ai 相关事故达到了二百三十三起

创下了历史新高

比二零二三年增加了百分之五十六点四

在主要工业模型的开发者中

标准化的ii 评估仍然很少

不过呢

像helm safety

Air bench 和facx 等新的基准正在为评估事实性和安全性提供了为有效的工具

在公司中

识别ri 风险和采取有意义的行动之间仍然存在着差距

相比之下

政府表现出了更大的紧迫性

因此我们看到

在二零二四年

全球在人工智能治理方面的合作有所加强

包括经合组织

欧盟

联合国和非洲联盟在内的组织都发布了关注透明度

可信度和其他核心的负责任ai 的框架

二零二四年主流ai 学术会议中

被接受的负责任ai 相关论文数量达到了一千二百七十八篇

比二零二三今年年的九十二篇增加了百分之二十八点八

这个趋势自从二零一九年以来稳步的提升

也显示了学术界对于负责任ai 议题的持续关注与重视

第六点

全球ai 的乐观情绪在上升

但是不同的地区之间仍然存在着深层次的分歧

在中国呢

有百分之八十三

印度尼西亚百分之八十和泰国百分之七十七的人认为ai 产品和服务是利大于弊的

而相比之下

加拿大只有百分之四十

美国百分之三十九和荷兰百分之三十六的人持有对ai 的乐观情绪

不过呢

这种情绪也正在转变

自从二零二二年以来

几个先前持怀疑态度的国家

乐观情绪明显都在增长

其中德国和法国增长了百分之十

加拿大增长了百分之八

英国增长了百分之八

以及美国增长了百分之四

第七点

Ai 正在变得更加高效

经济

实惠以及容易获取

越来越强大的小模型出现

比如说在二零二二年

能够在mmlu 测试中达到百分之六十以上分数的最小模型是拥有五千四百亿参数pom

然而到了二零二四年

微软的five 三mini 只需要三十八亿参数就能够达到同样的表现

也就是说

在短短的两年时间内

模型的参数量缩减了一百四十二倍

另外

如果以gbt 三点五的智能水平为标准

模型的推理成本在二零二二年十一月到二零二四年十月这两年间

更是下降了二百八十倍

在ai 硬件层面

成本每年下降百分之三十

而能效则每年提高百分之四十

开放权重模型也在缩小与封闭模型的差距

在某些基准测试中

一年内两者的性能差距从百分之八减少到了仅剩百分之一点七

这些趋势共同迅速降低了高级人工智能的门槛

第八点

各国政府正在加强对ai 的监管和投资

二零二四年

美国联邦机构出台了五十九项与ai 相关的法规

是二零二三年的两倍多

发布法规的机构数量也是二零二三年的两倍

在全球范围内

自从二零二三年以来

七十五个国家的ai 立法提及率上升了百分之二十一点三

自二零一六年以来增长了九倍

在日益受到关注的同时

各国政府也在进行大规模的投资

比如加拿大承诺投资二十四亿美元

中国启动了四百七十五亿美元的半导体基金

法国承诺投资一千零九十亿欧元

印度承诺投资十二点五亿美元

沙特阿拉伯则发起了一项一千亿美元的倡议

第九点

Ai 和计算机科学教育正在扩大

但是普及程度仍然不够

如今呢

已经有三分之二的国家提供或者计划提供k 十二阶段的计算机科学教育

这个数字呢

是二零一九年的两倍

其中非洲和拉丁美洲取得的进展最大

在美国

拥有计算机学士学位的毕业生人数在过去十年间增加了百分之二十二

然而在许多非洲国家

由于电力等基础设施的不足

获得计算机学位的机会仍然有限

在美国

百分之八十一的k 十二计算机科教师表示

Ai 应该成为计算机科学基础教育的一部分

但是只有不到一半的教师认为自己有能力教授ai

第十点

Ai 工业界仍然一路领先

二零二四年有将近百分之九十的著名人工智能模型都来自于工业界

高于二零二三年的百分之六十

其中谷歌和open i 凭借着七款重要模型位居榜首

阿里凭借着六款模型位居第三字节deep sik

腾讯质朴ai 分别凭借着两款模型上榜

模型的规模也在持续快速增长

训练计算每五个月翻一番

数据集每每个月翻一番

耗电量每一年翻一番

阿过呢

模型之间的性能差距正在缩小

比如说排名第一和第十的模型之间的得分差距在一年内从百分之十一点九降到了百分之五点四

排名前两位的差距现在仅为百分之零点七

一句话就是前沿模型的竞争越来越激烈

不过呢

挑战难度更高的新基准也在不断的出现

比如说在人类中级考试中

目前表现最好的ai 系统得分仅为百分之八点八

而在专门用于复杂数学问题的frtier mas 测试中

Ai 成功率只有百分之二

在big code bench 基准测试中

Ai 生成代码的成功率目前仅为百分之三十五点五

远低于人类的百分之九十七的水平

开源ai 项目的数量也在持续的增长

从二零一一年的一千五百四十九个

激增到了二零二四年的大约四百三十万个

特别值得注意的是

仅仅过去一年内

Github ai 项目的总量就实现了百分之四十点三的陡增

截止到二零二四年

美国贡献了github 中百分之二十三点四的ai 项目

占据最大份

印度度百分之十九点九的占比位居第二

欧洲紧随其后

贡献了百分之十九点五的项目

第十一点

Ai 因为对于科学的影响而斩获最高荣誉

不可否认的是

Ai 的重要性与之俱增

这一点呢

从重大科学奖项中就可见一斑

两项诺贝尔表彰了ai 在深度学习和蛋白质折叠中的应用

而图灵奖则表彰了ai 在强化学习方面的开创性贡献

Ai 研究论文的总量持续的增长

已经主导了计算机科学领域

二零一三年到二零二三年期间

Ai 研究论文的数量从十点二万篇加到了二十四点二万篇

在计算机科学论文中的占比从百分之二十一点六提升到了百分之四十一点八

从地区来看

中国大陆的ai 论文发表总量领先

二零二三年

中国大陆机构的ai 论文在全球总发表量中占比为百分之二十三点二

被引用量占比为百分之二十二点六

美国则发表了更多高影响力的研究

二零二一年到二零二三年

美国分别贡献了ai 领域top 一百高引用论文中的六十四篇

五十九篇与五十篇

中国大陆分别贡献了三十三篇

三十四篇与三十四篇

第十二点

复杂推理仍然是一项严峻的挑战

虽然在国际数学奥林匹克竞赛问题等等任务中

O 一模型的得分高达百分之七十四点四

远高于gpt 四o 的百分之九点三

但是这种高水平的推理也带来了代价

O 一模型的成本是gpt 四o 的近六倍

运行速度则慢了三十倍

而且呢

在plan bench 等复杂推理基准测试中

Ai 模型仍然面临着许多的挑战

即使存在着可以被证明是正确的解决方案

他们也常常无法可靠的解决逻辑任务

这就限制了ai 在一些精度至关重要的高风险环境中的有效性

好了

以上就是这篇报告的一些重点内容了

总的来说

对于人工智能

二零二四年应该可以说是极其美好的一年

诺贝尔物理学奖和化学奖

以及因为强化学习的奠击性工作而获得的图灵奖

都体现了对ai 在推动人类知识进步方面作用的认可

曾经困难重重的图灵测试也已经不再被视为一个难以挑战的目标

顶尖模型已经可以做到以假乱真

与此同时

Ai 的应用还正在以前所未有的速度加速发展

数以百计计人人正在专业工作和休闲活动中使用着ai 产品

相信随着高性能

低成本和开放模型的普及

Ai 的可及性和影响力必然将进一步的扩大

此外

在经历了短暂的放缓之后

企业对于ai 的投资也开始出现反弹

最近获得融资的生成式ai 初创企业的数量增加了将近两倍

企业采用ai 的速度在二零二四年也显著的加快

Ai 已经从边缘领域正在逐渐成为商业价值的核心驱动力

政府呢

也在加大参与的力度

政策的制定者们不再只是在讨ai

而是在投资ai

一些国家启动了价值十亿美元的国家ai 基础设施计划

包括扩大能源能力来支持ai 的发展

不过人们对于ai 的信任仍然是一大挑战

越来越少的人相信ai 公司会保护他们的担忧

同时存在对公平性和偏见的担忧

公误的信息也在持续的构成风险

尤其是在选举和deep fake 泛滥的情况下

对此呢

各国政府正在推进新的监管框架

希望能够促进透明度

问责制和公平性

错众的态度呢

也在发生转变

虽然怀疑的态度依然是存在的

但是呢

人们对于ai 能够带来广泛社会效益的乐观态度正在明显的上升

无论如何

如今的ai 显然已经不再只是一个关于可能性的故事了

而是一个关于正在发生的事情

以及我们如何共同塑造人类未来的故事了

感谢大家观看本期视频

我们下期再见

展开显示全部歌词