本字幕由TME AI技术生成
大家好
这里是最佳拍档
我是大飞
四月七号
由李飞飞联合领导的斯坦福大学hai 研究所发布了最新的二零二五年人工智能指数报告
大概呢
不到一年前
我们曾经解读过长达五百页的二零二四年的报告
而今年的报告呢
也长达四百五十六页
不仅涵盖了研发技术
性能
负责任的人工智能
经济影响
科学和医学
政策
教育和公众舆论等等主题的图表和数据海
新增了对ai 硬发展状况的深入分析
对推理成本的新的估算
以及对于ai 出版和专利申请趋势的分析
Hai 呢
在自己的官网上也写到
这是我们迄今为止发布的最全面的版本
人工智能对于社会的影响从来没有如此的明显
他们还认为ai 将成为二十一世纪最具有变革性的技术
不过呢
除非我们精心的引导ai 行业的发展
否则这项技术将难以惠及普罗大众
那么这份报告究竟都说了什么呢
又为什么表达了这样的单一呢
今天大飞就来为大家解读一下
看看这一年间
Ai 究竟都发生了哪些变化
为了节省大家的时间
我将主要介绍报告的十二个核心要点
完整的报告内容
建议大家有时间还是阅读原文
首先第一点
Ai 在苛刻基准上的表现持续的提升
二零二三年
研究人员引入了一些新的基准
包括如今大家熟悉的mmmugpqa 和swe bunch
用来测试前沿ai 模型的性能极限
然而仅仅一年之后
模型的性能就大幅提升
在mmmugpqa 和swe bunch 上的得分分别提高了十八点八
四十八点九和六十七点三个百分点
在swe bunch 编程测试中
Ai 系统在二零二三年只能解决百分之四点四的问题
但是到了二零二四年
这个数字猛增到了惊人的百分之七十一点七
在基准测试之外
Ai 系统在生成高质量视频方面也取得了重大的进展
包括open i 的sorver
Stable diffusion 的三d 四d
Meate 的mobe g
以及谷歌demine 的view two
在某些场景下
基于大元模型的agent 甚至在短时间任务上会超越人类
比如说在二零二四年推出的re 半尺的测试平台
在两小时内的短期任务中
顶尖ai 系统的表现是人类专家的四倍
但是随着任务持续时间延长到三十二小时
人类专家的表现反而会超过ai 两倍
不过呢
在像编写trade 内核这种编程任务上
Ai agent 的表现已经能够匹敌人类专家
而且更快
成本更低
第二点
Ai 正在越来越多的融入到人们的日常生活中
从医疗保健到交通运输
如今我们可以看到
Ai 正在迅速的从实验室走向日常生活
在医疗方面
二零二三年
Fda 批准了二百二十三种ai 医疗设备
而二零一五年仅为六种
在交通方面
美国最大的自动驾驶运营商vivo 每周提供了超过十五万次的自动驾驶出行
而百度的罗布快跑自动驾驶出租车现在呢
也已经在中国多个城市提供服务
第三点
企业全力的投入ai
推动投资和使用创历史新高
二零二四年
全球企业对于ai 的投资达到了创纪录的两千五百二十三亿美元
其中私人投资增幅高达百分之四十四点五
企业并购活动则增长了百分之十二点一
过去十年
这个领域呈现出了爆发式的增长
投资总额相比于二零一四年增长了超过十三倍
其中生成式ai 尤其的强劲
其球吸引的私营投资总共为三百三十九亿美元
比二零二三年增长了百之十八点七
美国呢
也正在进一步的巩固在全球ai 私人投资中的领先地位
二零二四年
仅美国私人ai 投资就增长到了一千零九十亿美元
这几乎是中国总投资九十三亿美元的十二倍
是英国总投资四十五亿美元的二十四倍
而在生成式ai 领域
美国的投资额超过了中国
欧盟和英国之和的二百五十四亿美元
也远远高于二零二三年的二百一十八亿美元
Ai 的商业应用也在加速
二零二四年
百分之七十八的组织报告称有在使用ai
比前年的百分之五十五增长了百分之二十三
尤其是在生成式ai 方面
从二零二三年的百分之三十三迅速增长到了去年的百分之七十一
同时呢
越来越多的研究证实ai 提高了生产力
并且在大多数的情况下有助于缩小劳动力中的技能差距
第四点
在创造顶级ai 模型方面
中国正在缩小与美国的差距
明零二四年
美国机构总共推出了四十个引人注目的ai 模型
明显超过了中国的十五个和欧洲的三个
虽然美国在数量上保持领先
但是中国模型在质量上迅速缩小了差距
比如说在mmlummmu mass 和human evil 等主要基准上的性能差异
从二零二三年的十七点五
十三点五
二十四点三和三十一点六个百分点
缩小到了二零二四年底的零点三
八点一
一点六和三点七个百分点
同时
中国在ai 出版物和专利方面继续领先
与此同时
模型的开发也越来越全球化
中东
拉丁美洲和东南亚等地区也推出了引人注目的新模型
第五点
负责任的ai 生态系统在不断的发展
但是处于不均衡的状态
人工智能的相关事件急剧的上升
二零二四年报告的ai 相关事故达到了二百三十三起
创下了历史新高
比二零二三年增加了百分之五十六点四
在主要工业模型的开发者中
标准化的ii 评估仍然很少
不过呢
像helm safety
Air bench 和facx 等新的基准正在为评估事实性和安全性提供了为有效的工具
在公司中
识别ri 风险和采取有意义的行动之间仍然存在着差距
相比之下
政府表现出了更大的紧迫性
因此我们看到
在二零二四年
全球在人工智能治理方面的合作有所加强
包括经合组织
欧盟
联合国和非洲联盟在内的组织都发布了关注透明度
可信度和其他核心的负责任ai 的框架
二零二四年主流ai 学术会议中
被接受的负责任ai 相关论文数量达到了一千二百七十八篇
比二零二三今年年的九十二篇增加了百分之二十八点八
这个趋势自从二零一九年以来稳步的提升
也显示了学术界对于负责任ai 议题的持续关注与重视
第六点
全球ai 的乐观情绪在上升
但是不同的地区之间仍然存在着深层次的分歧
在中国呢
有百分之八十三
印度尼西亚百分之八十和泰国百分之七十七的人认为ai 产品和服务是利大于弊的
而相比之下
加拿大只有百分之四十
美国百分之三十九和荷兰百分之三十六的人持有对ai 的乐观情绪
不过呢
这种情绪也正在转变
自从二零二二年以来
几个先前持怀疑态度的国家
乐观情绪明显都在增长
其中德国和法国增长了百分之十
加拿大增长了百分之八
英国增长了百分之八
以及美国增长了百分之四
第七点
Ai 正在变得更加高效
经济
实惠以及容易获取
越来越强大的小模型出现
比如说在二零二二年
能够在mmlu 测试中达到百分之六十以上分数的最小模型是拥有五千四百亿参数pom
然而到了二零二四年
微软的five 三mini 只需要三十八亿参数就能够达到同样的表现
也就是说
在短短的两年时间内
模型的参数量缩减了一百四十二倍
另外
如果以gbt 三点五的智能水平为标准
模型的推理成本在二零二二年十一月到二零二四年十月这两年间
更是下降了二百八十倍
在ai 硬件层面
成本每年下降百分之三十
而能效则每年提高百分之四十
开放权重模型也在缩小与封闭模型的差距
在某些基准测试中
一年内两者的性能差距从百分之八减少到了仅剩百分之一点七
这些趋势共同迅速降低了高级人工智能的门槛
第八点
各国政府正在加强对ai 的监管和投资
二零二四年
美国联邦机构出台了五十九项与ai 相关的法规
是二零二三年的两倍多
发布法规的机构数量也是二零二三年的两倍
在全球范围内
自从二零二三年以来
七十五个国家的ai 立法提及率上升了百分之二十一点三
自二零一六年以来增长了九倍
在日益受到关注的同时
各国政府也在进行大规模的投资
比如加拿大承诺投资二十四亿美元
中国启动了四百七十五亿美元的半导体基金
法国承诺投资一千零九十亿欧元
印度承诺投资十二点五亿美元
沙特阿拉伯则发起了一项一千亿美元的倡议
第九点
Ai 和计算机科学教育正在扩大
但是普及程度仍然不够
如今呢
已经有三分之二的国家提供或者计划提供k 十二阶段的计算机科学教育
这个数字呢
是二零一九年的两倍
其中非洲和拉丁美洲取得的进展最大
在美国
拥有计算机学士学位的毕业生人数在过去十年间增加了百分之二十二
然而在许多非洲国家
由于电力等基础设施的不足
获得计算机学位的机会仍然有限
在美国
百分之八十一的k 十二计算机科教师表示
Ai 应该成为计算机科学基础教育的一部分
但是只有不到一半的教师认为自己有能力教授ai
第十点
Ai 工业界仍然一路领先
二零二四年有将近百分之九十的著名人工智能模型都来自于工业界
高于二零二三年的百分之六十
其中谷歌和open i 凭借着七款重要模型位居榜首
阿里凭借着六款模型位居第三字节deep sik
腾讯质朴ai 分别凭借着两款模型上榜
模型的规模也在持续快速增长
训练计算每五个月翻一番
数据集每每个月翻一番
耗电量每一年翻一番
阿过呢
模型之间的性能差距正在缩小
比如说排名第一和第十的模型之间的得分差距在一年内从百分之十一点九降到了百分之五点四
排名前两位的差距现在仅为百分之零点七
一句话就是前沿模型的竞争越来越激烈
不过呢
挑战难度更高的新基准也在不断的出现
比如说在人类中级考试中
目前表现最好的ai 系统得分仅为百分之八点八
而在专门用于复杂数学问题的frtier mas 测试中
Ai 成功率只有百分之二
在big code bench 基准测试中
Ai 生成代码的成功率目前仅为百分之三十五点五
远低于人类的百分之九十七的水平
开源ai 项目的数量也在持续的增长
从二零一一年的一千五百四十九个
激增到了二零二四年的大约四百三十万个
特别值得注意的是
仅仅过去一年内
Github ai 项目的总量就实现了百分之四十点三的陡增
截止到二零二四年
美国贡献了github 中百分之二十三点四的ai 项目
占据最大份
印度度百分之十九点九的占比位居第二
欧洲紧随其后
贡献了百分之十九点五的项目
第十一点
Ai 因为对于科学的影响而斩获最高荣誉
不可否认的是
Ai 的重要性与之俱增
这一点呢
从重大科学奖项中就可见一斑
两项诺贝尔表彰了ai 在深度学习和蛋白质折叠中的应用
而图灵奖则表彰了ai 在强化学习方面的开创性贡献
Ai 研究论文的总量持续的增长
已经主导了计算机科学领域
二零一三年到二零二三年期间
Ai 研究论文的数量从十点二万篇加到了二十四点二万篇
在计算机科学论文中的占比从百分之二十一点六提升到了百分之四十一点八
从地区来看
中国大陆的ai 论文发表总量领先
二零二三年
中国大陆机构的ai 论文在全球总发表量中占比为百分之二十三点二
被引用量占比为百分之二十二点六
美国则发表了更多高影响力的研究
二零二一年到二零二三年
美国分别贡献了ai 领域top 一百高引用论文中的六十四篇
五十九篇与五十篇
中国大陆分别贡献了三十三篇
三十四篇与三十四篇
第十二点
复杂推理仍然是一项严峻的挑战
虽然在国际数学奥林匹克竞赛问题等等任务中
O 一模型的得分高达百分之七十四点四
远高于gpt 四o 的百分之九点三
但是这种高水平的推理也带来了代价
O 一模型的成本是gpt 四o 的近六倍
运行速度则慢了三十倍
而且呢
在plan bench 等复杂推理基准测试中
Ai 模型仍然面临着许多的挑战
即使存在着可以被证明是正确的解决方案
他们也常常无法可靠的解决逻辑任务
这就限制了ai 在一些精度至关重要的高风险环境中的有效性
好了
以上就是这篇报告的一些重点内容了
总的来说
对于人工智能
二零二四年应该可以说是极其美好的一年
诺贝尔物理学奖和化学奖
以及因为强化学习的奠击性工作而获得的图灵奖
都体现了对ai 在推动人类知识进步方面作用的认可
曾经困难重重的图灵测试也已经不再被视为一个难以挑战的目标
顶尖模型已经可以做到以假乱真
与此同时
Ai 的应用还正在以前所未有的速度加速发展
数以百计计人人正在专业工作和休闲活动中使用着ai 产品
相信随着高性能
低成本和开放模型的普及
Ai 的可及性和影响力必然将进一步的扩大
此外
在经历了短暂的放缓之后
企业对于ai 的投资也开始出现反弹
最近获得融资的生成式ai 初创企业的数量增加了将近两倍
企业采用ai 的速度在二零二四年也显著的加快
Ai 已经从边缘领域正在逐渐成为商业价值的核心驱动力
政府呢
也在加大参与的力度
政策的制定者们不再只是在讨ai
而是在投资ai
一些国家启动了价值十亿美元的国家ai 基础设施计划
包括扩大能源能力来支持ai 的发展
不过人们对于ai 的信任仍然是一大挑战
越来越少的人相信ai 公司会保护他们的担忧
同时存在对公平性和偏见的担忧
公误的信息也在持续的构成风险
尤其是在选举和deep fake 泛滥的情况下
对此呢
各国政府正在推进新的监管框架
希望能够促进透明度
问责制和公平性
错众的态度呢
也在发生转变
虽然怀疑的态度依然是存在的
但是呢
人们对于ai 能够带来广泛社会效益的乐观态度正在明显的上升
无论如何
如今的ai 显然已经不再只是一个关于可能性的故事了
而是一个关于正在发生的事情
以及我们如何共同塑造人类未来的故事了
感谢大家观看本期视频
我们下期再见