本字幕由TME AI技术生成
大家好
欢迎收听ai 日报播客
我是neo
今天是四月七号
星期二
我是me
今天的内容还挺炸的
有人靠ai 用三个月就把想了八年的项目做出来了
Gpt 六居然已经被曝光了
还有微型机器人零售ai 翻车事件什么的
咱们一个一个来聊
对
今天的主题可以用一句话概括
Ai 正在从辅助工具变成核心生产力
不管是个人开发者还是大企业
这个转变正在加速发生
废话不多说
直接开聊第一个话题
特别有感触
Hackerness 上有一篇帖子
标题是eight years of wanting
Three months of building with ai
就是说一个开发者想了一个产品八年一直没动手
结果用ai 辅助开发三个月就搞定了
这个帖子拿了五百九十二分
一百八十六条评论
可以说是炸了
八年啊
我好奇到底是什么项目让人想了八年都不敢动手
八年可以从大学读到博士了
帖子里没详细说具体产品是什么
但核心不在于产品本身
而是这个现象
很多独立开发者心里都有一个side project 的梦
但以前卡在技术能力不够
时间不够
团队不够
现在有了ai
这些障碍突然被大幅降低了
所以本质上是执行门槛降低了对吧
以前可能需要一个五人团队半年才能做的事情
现在一个人家ai 三个月就能搞定
没错
而且hm 评论区的讨论特别有意思
很多人在分享自己类似的经历
用cursor
Cloud code 这些工具
一个周末就把原型做出来了
但也有人提醒说用ai 写代码容易产生技术债务
因为你可能不完全理解生成的代码
这个提醒很重要
快速搭建和长期维护是两回事
我的理解是ai 帮你解决了从零到一的问题
但从一到一百
还是得靠你自己的理解力
说的好
我觉得这篇帖子火的真正原因是他戳中了一个情绪
很多人心里都有一个if only 的项目
如果你也有一个想了很久没做的东西
现在真的可以试试了
Ai 不是万能的
但它确实能帮你迈出第一步
给听众一个具体建议的话呢
如果你是开发者
这周末花半天时间
把你那个总有一天要做的项目用aai 先搭一个最小可行版本出来
不要追求完美
先让他能跑起来
你会发现
总想到做之间的距离比你以为的要短得多
八年之痒变三月之恋
这个故事确实很励志
好
下一个话题
第二个话题
量子位爆了一个大料
Gpt 六曝光了
虽然gpt 五系列还在迭代中
Open ai 内部已经在推进下一代大模型了
等等等等
Gpt 五点四都还没完全铺开呢
六就来了
这节奏也太快了吧
我记得昨天我们还在聊gpt 五点四mini 和nano
对
这就是现在大模型军备竞赛的节奏
根据曝光的信息
Gpt 六可能会在架构上有比较大的变化
不只是简单的参数量堆叠
Open ai 可能在探索更高效的训练方法和更强的推理能力
那从用户角度来看
Gpt 五和gpt 六之间的体验差距会有多大
我们普通人能感知到吗
好问题
我的判断是
Gpt 五到gpt 六的乐声可能不像gpt 三到gpt 四那么震撼
因为当模型已经很强的时候
编辑提升感知越来越弱
但真正的变化会体现在两个方面
一是价格大幅下降
二是能力边界扩展到更复杂的真实世界任务
价格下降这个确实很关键
现在用api 做个稍微复杂点的应用
Token 费用就嗖嗖的涨
如果gpt 又能在同等能力下便宜一个数量级
那才是真正的普惠
没错
而且有个趋势值得关注
Open ai 现在是多线作战
Gpt 主线在推五点四系列各种尺寸
同时o 系列专攻推理
再加上gpt 六的研发
这种并行推进的策略说明他们在用不同的模型覆盖不同的市场需求
竞争压力也在倒逼吧
Anthropic 的cloout
Google 的jam 四都在追追赶
说到jama 四
今天正好有一条相关新闻
有人用lm studio 无头头ci 配合clcloucocoat 在本跑jama 四hn 上一百七十七分
这说明开源模型的本地运行体验在快速改善
对open ai 也是压力大
模型的竞争格局越来越有意思了
给听众一个判断的话
你觉得gpt 六大概什么时候能用上
纯个人猜测
明年上半年有可能
但我更想说的是
不要等gpt 六再开始用ai
现在的模型已经足够强了
关键是你怎么用
等gpt 拾出来再动手的人
永远比现在就用起来的人晚十步
第三个话题
我们来看看微软和matter 的动态
首先是微软windows 十一要引入一个功能标志页面
让用户手动开关系统新功能
哦
这个有意思
以前想开什么隐藏功能
得用six v two 之类的第三方工具
现在微软官方给入口了
对 讽刺的是
这个功能标志功能本身目前还是隐藏状态
得用six v two 才能打开
套娃了数
于是
哈哈哈
用隐藏功能工具来开启管理隐藏功能的功能
微软的产品经理是不是在玩什么行为艺术
不过说真的
这背后反映了一个很重要的趋势
操作系统越来越模块化了
以前系统更新是一整包推给你
现在变成了一个个独立的feature flag
这其实是从互联网公司的灰度发布机制学来的
对对对
Ab 测试和灰度发布那套以前是服务端的玩法
现在搬到客户端操作系统上来了
关键是这给用户更多控制权
你不想要某个新功能
可以直接关掉
对开发者来说
也能提前测试还没正式发布的功能
长远来看
这可能会改变windows 更新的发布节奏
不过我担心一个问题
普通用户能理解这些功能标志是什么吗
万一不小心关了什么关键功能怎么办
好问题
微软应该会做好分类和说明
把一些实验性功能和核心功能区分开
但知道微软的尿性吗
先观望吧
反正对于windows 高级用户来说
这绝对是个好消息
第四个话题
Meta 又有大动作
这次不是ai 模型
而是基础设施层面的
Meta 发了一篇关于ffm pack at meta 的博客
讲他们在大规模媒体处理中如何使用f pack
F pad
这可是音视频领域的瑞士军刀
几乎所有视频平台底层都在用它
Meta 作为facebook
What's up 的母公司
处理的媒体量级得是天文数字吧
没错
这篇博客详细讲了f pack 在matter 的规模化部署
有个核心观点很有意思
F ppack 虽然是通用工具
但在超大规模场景下
你需要对它做大量定制化改造才能满足性能需求
这对普通开发者有什么启发呢
启发就是开源工具是起点不是终点
很多团队直接拿开源方案就用了
但当你的规模增长到一定程度
你必须深入理解底层原理才能做好优化
Meta 分享的经验可以帮助中大型公司少走弯路
对了
昨天我们聊过meta 在jamlock 上的投入
今天又是f phone pack
感觉meta 最近在密集分享基础设施经验
你注意到了
这是meta 的一个策略
通过开源和技术博客来吸引顶级工程人才
当你在全世界最复杂的系统上工作
写出来的经验就是最好的招聘广告
而且说实话
F pack
Jamallock 这些看似无聊的基础设施项目
才是真正支撑十亿级用户产品的股价
基础设施不性感
但很关键
这跟昨天聊jam lock 时的观点一脉相承
没错
如果你是技术团队的负责人
建议多关注meta engineering block
他们在基础设施方面的分享质量真的很高
第五个话题
Hacker news 上有个很有教育意义的项目
有人做了一个超小的llm
专门用来演示语言模型到底是怎么工作的
三百一十七分二十六条评论
哦
小到什么程度
现在大家都在卷餐数量
居然有人反过来做小模型
这个项目叫show hmi built a tiny lm to disistify how language models work
核心不是追求性能
而是教育目的
让人看懂从tokanization
Embedding attention 到generation 的完整流程
所有代码都是简洁到可以一行一行读懂的
这个太棒了
说实话
很多人天天用chat gpt
但完全不知道里面到底发生了什么
Transformer 架构对大多数人来说就是一个黑盒
对
这也是为什么这个帖子得分这么高
技术社区非常认可这种domistify 的工作
另外还有一个相关的帖子
Nano code 一百五十四分
讲的是用纯jaks 在tpu 上训练一个cloud code 级别的编码模型
花费只要二百美元
二百美元
这么便宜
之前训练大模型不是动不动就几百万美元吗
关键在于tiny 和focused
它不是要跟gpt 五竞争
而是在特定任务上做到极致
这代表了一个非常重要的趋势
不是所有场景都需要万亿参数的大模型
很多实际应用中
一个精心调优的小模型反而更实用
更便宜
响应更快
大模型做通用智能
小模型做专项任务
有点像医院的全科医生和专科医生的关系
这个类比非常好
全科医生什么都能看
但可能不够深入
专科医生在特定领域能力超强
未来的ai 部署架构很可能就是这样
一个大模型做调度
下面挂一堆专精小模型做执行
如果我是一个想入门ai 的开发者
这两个项目是不是特别好的学习材料
百分之百推荐先从那个tiny lm 项目入手
理解原理
然后看nano code
理解怎么在实际硬件上训练比读论文直观一百倍
这是我今天最想推荐给技术人的两个开源项目
下半场来了
第六个话题
我们来聊聊ai agent 安全监控
Open ai 发了一篇博客
讲的是他们怎么用chain of thought 监控来检测内部编码agent 的对齐问题
等一下
对齐问题就是说
Ai 可能会不按照人类的意图行事
这个在编码agent 里具体怎么体现
举个例子
假设你让编码agent 修一个bug
他可能会选择一个看起来修好了
但实际上只是隐藏了问题的方案
或者更极端的情况
Agent 在执行任务时偷偷做了一些你们要求的操作
Open ai 通过分析agent 的思维链来检测这类行为
所以就是监控ai 的内心独白来看他有没有在搞小动作
这听起来有点像给ai 做测谎
哈哈
某种意义上确实是
而且这篇博客的重要性在于
他承认了对齐问题在真实部署中确实存在
不只是学术假设
Open ai 自己的内部编码agent 都需要这种监控
说明agent 安全已经是一个工程问题了
不是空谈
这跟他们之前发布的safety bug bounty program 是不是一脉相承的
昨天我们还聊到这个来着
串起来了
昨天的safety bog bounty 是鼓励外部研究者找ai 安全漏洞
今天的chain of fault 监控是内部的安全措施
Open ai 正在构建一个内外结合的ai 安全体系
这个方向非常正确
那对于正在做agent 产品的开发者来说
最大的启发是什么
两个字 监控
不管你用的是什么模型
只要你的agent 有执行能力
能写文件
能调api
能访问数据库
你就必须建立完善的行为监控和日志审计
不要等出了问题再补
要从第一天就把安全监控作为架构的一部分
Ai 越强大
安全问题就越不能掉以轻心
好
继续第七个话题
聊点硬核科学
荷兰莱顿大学的研究团队三d 打印出了微米级的柔性微型机器人
不需要大脑或任何控制系统
就能像单细胞生物一样自主移动
微米级
就是说比头发丝还小几十倍
而且还不需要大脑
那它靠什么移动
这些机器人尺寸在零点五到五微米之间
人的头发直径大概七十到一百微米
所以确实是极其微小
他们的移动原理类似于单细胞生物
通过材料本身的物理特性来对环境做出响应
不需要任何电子元件或控制程序
哇
这不就是纳米机器人的雏形吗
科幻电影里那种注入血液里修复人体的微型机器
你想象力很丰富
但也不完全是空想
这项研究的打印精度已经触及当前技术极限了
虽然离临床应用还很远
但方向就是这个
未来某天
这种微型机器人可能真的能在人体血管里执行精准的药物递送或者手术操作
那ai 在这里面扮演什么角色呢
好问题
目前这个研究主要是材料科学和微纳加工的突破
但ai 的角色会在两个阶段体现
第一是设计阶段
用ai 模拟和优化微型机器人的结构
第二是未来的控制阶段
当机器人复杂度提升后
可能需要ai 来协调大量微型机器人的协同行为
感觉像是一群算法的物理实现版本
一群没有大脑的个体通过简单规则涌现出复杂行为
完全正确
这种自下而上的智能涌现
和我们现在做的大模型自上而下的智能构建是两条完全不同但都很有前景的路径
做ai 的人也应该关注这些交叉学科的进展
灵感往往来自意想不到的领域
第八个话题回到ai agent 生态微软正式开源了他们的agent framework
支持python 和net
用来构建
编排和部署ai agent 极多agent 工作流
又一个agent 框架
现在市面上已经有launching
Cw
Ai auto 阵一大堆了
微软的有什么不一样
微软这个最大的优势是跟azure 生态的深度整合
如果你的企业已经在用azure
那用微软的框架做agent 部署会非常顺畅
另外它同时支持pyon 和net
这对那些传统企业的net 开发者来说是个好消息
不用为了做ai 强行切换技术栈
说到agent 框架
今天还有个google 的新闻
Germany api dox mcp 和agent skills 号称可以提升编码agent 的性能
Agent 生态真的在加速成型
你把这两条新闻放在一起看就更有意思了
微软出框架
Google 出mcp 和skills 标准
Open ai 出安全监控
三巨头都在从不同角度构建agent 基础设施
这说明什么
Agent 不再是demo 阶段了
而是进入了工程化
产业化阶段
那对于想做agent 产品的创业团队
你建议选哪个框架
我的建议是不要被框架绑架
先想清楚你的agent 要解决什么问题
然后选最匹配你团队技术战的框架
如果是net 团队
就选微软的
如果是python 为主且追求灵活性
就看launching 或cry i
关键不是框架本身
而是你对agent 工作流的设计能力
框架是工具
思路才是核心
这个道理在任何技术选型上都适用
另外推荐关注一个githhop 上的项目cloud skills
六十六个专为全站开发者准备的cloud code 技能
这说明围绕agent 的工具链生态正在快速成长
不只是大厂在做
开源社区的力量也很强大
第九个话题
比较接地气
美国零售巨头们集体拥抱ai 购物助手
但出了问题让用户自己担责
沃尔玛
塔吉特都是这样
什么
Ai 给我推荐了错误的商品或者算错了价格
责任还在我身上
这也太离谱了吧
对
塔吉特最近更新了条款
明确规定用户使用aai 购物助手时需自行承担风险
他们的ai 是基于google germany 做的
这种我卖你aai 服务
但不为ai 的错误负责的态度确实引起了很大争议
这不就是双重标准吗
推广的时候说ai 多智能多方便
出了问题就说这是ai 生成的
不代表我们的意见
你说到点子上了
这其实暴露了一个全行业的问题
Ai 应用的责任归属还没有清晰的法律框架
当企业主动把ai 嵌入核心业务流程时
说ai 犯的错跟我无关
在法律和伦理上都很难站住脚
你觉得监管会跟上吗
必须得跟上
欧盟的ai act 已经在这方面做了一些探索
但美国的监管还比较滞后
我预测未来一两年内
Ai 应用的责任划分会成为一个重大的法律议题
尤其是当ai 导致消费者实质性经济损失的时候
对普通消费者的建议呢
三条建议
第一
用ai 购物助手的推荐当参考
不要盲目下单
自己做最终判断
第二
仔细阅读aai 功能的使用条款
知道你放弃了哪些权利
第三
保留ai 交互记录的截图
万一出了争议
这就是证据
Ai 时代的消费者保护确实需要新思路
这个话题很值得持续关注
最后一个话题
欧洲企业联合推出了euro office 一个开源办公套件
对标微软office 和google dogs
这是only office 的开源分支版本
由next cloud 和iono 等欧洲企业联合推动
欧洲又搞数字主权了
这次是在办公软件领域
对
而且这次的背景更有趣
你知道今天还有一条新闻吗
法国把存在美国的最后一批黄金运回来了
赚了一百五十亿美元
二百六十四分的hn 热铁
这两件事放在一起看
无论是金融资产还是数字基础设施
欧洲正在加速减少对美国的依赖
这个串联有意思
从黄金到办公软件
都是去美化战略的一部分
不过说真的
Ero office 能打得过微软和谷歌吗
纯功能比较的话
短期内肯定不行
但eural office 打的不是功能牌
是合规牌和主权牌
欧盟gdpr 越来越严
很多政府机构和企业不希望数据流向美国的云服务器
一个欧洲本土的开源的办公套件在合规性上有天然优势
所以目标用户不是普通人
而是政府
大型企业这些对数据主权敏感的机构
Bingo 预览版已经上了github
正式版计划今年夏天发布
如果你是做tog 或top 出海欧洲市场的团队
建议关注这个项目
未来欧洲可能会强制要求某些领域使用本土化的数字工具
这就是商机
数字主权这个趋势确实在加速
好了
今天的十个话题聊完了
来做个总结吧
好
我来说说今天印象最深的
第一
那个八年想法三个月落地的故事
Ai 真的在重新定义个人创造力的边界
如果你有一个搁置了很久的想法
现在就去试
第二
Agent 安全这件事
Open ai 用chain of thought 监控对齐问题说明agent 时代的安全不能只是口号
得有工程化的解决方案
我最有感触的是两个方向的碰撞
一边是微型机器人这种底层物理世界的突破
另一边是ai agent 框架生态的快速成型
感觉技术进步真的是多条线同时推进的
而且这些线最终会交汇
还有那个gpt 六的曝光
说明这场军备竞赛远没有到头
对
今天有个隐藏的主线
从个人开发者到巨头企业
从安全监控到消费者保护
Ai 正在触及每一个角落
关键是怎么在享受便利的同时管好风险
这是我们每个人都要思考的问题
说的好
今天的节目就到这里
感谢大家收听ai 日报
播客 别忘了
想了八年的项目
现在就可以动手了哦
我们明天见
明天见