AI手机离线时代来了?从端侧模型到Agent大爆发-NeoCheung

AI手机离线时代来了?从端侧模型到Agent大爆发

歌手:NeoCheung

时间:2026-03-31

    使用手机浏览器「扫一扫」

    在手机上保存,获得更好体验

标签
歌词

本字幕由TME AI技术生成

Hello 各位

欢迎收听每日ai 资讯播客

今天是四月十七号

星期五

我是neo

大家好

我是米娅

今天有一条消息我看到直接惊了

谷歌的jm 四居然能直接在iphone 上跑了

完全离线

这算不算ai 民主化的里程碑

确实是今天最炸裂的消息之一

而且我们还有台积电利润暴涨五成

Firebase 密钥泄露烧掉五万四千欧元的惨案

Adobe 搞了个真正有脑子的ai 助手

内容非常丰富

话不多说

直接开聊

第一个话题绝对是今天的头条

Google jam 四可以在iphone 上原生运行了

完全离线推理

这条在hacker news 上二百六十八分一百六十七条评论

讨论热度炸裂

等等

Jm 四是谷歌的开源模型对吧

他怎么跑到苹果手机上去了

谷歌和苹果不是死对头吗

这就是开源的魅力

Jama 是谷歌开源的轻量级大模型系列

任何人都可以拿去部署

到了第四代模型小道可以直接在手机芯片上跑

不需要联网

不需要云端服务器

你想想这意味着什么

意味着你的aai 助手不需要网络也能工作

比如在飞机上

在地铁里

在信号不好的地方

没错

而且更关键的是隐私

所有数据都在本地处理

不上传到任何服务器

这对隐私敏感的场景是巨大突破

医疗记录分析

法律文件处理

个人日记助手

这些以前因为隐私顾虑不敢用云端ai 的场景现在都打开了

这对苹果的apple intelligence 是不是一个冲击

苹果自己搞了半天端测ai

结果谷歌的开源模型先在iphone 上跑起来了

这个观察非常犀利

苹果的策略一直是自己控制整个技术栈

但开源社区的速度太快了

Jama 四能在a 系列芯片上高效运行

说明移动端ai 的算力瓶颈基本上被突破了

我大胆预测

半年之内

我们会看到一大批基于本地大模型的app 出现

而且体验不会比云端差太多

如果你是独立开发者

这意味着什么

是不是说你不需要租gpu 服务器了

直接让用户的手机跑模型就行

完全正确

这彻底改变了ai 应用的成本结构

以前做个ai 应用

光服务器成本每月就好几千美元

现在呢

模型在用户设备上跑

你的编辑成本几乎为零

对三五个人的小团队来说

这是天大的好消息

你终于可以做一个aai 产品

不用担心用户量上来后服务气费爆炸

所以从创业角度看

端侧ai 可能催生一波新的独立开发者创业潮

不过我也好奇

在手机上跑的模型能力跟云端大模型比差多少

目前肯定还有差距

但关键是够用就行

你不需要在手机上跑一个能写论文的模型

你只需要他能准确理解你的语音指令

帮你整理笔记

做简单的翻译

对于这些日常任务

Gm 四已经绰绰有余了

这才是真正的ai 平权

不是每个人都需要gpt 五级别的能力

但每个人都应该有一个随身的ai 助手

第二个话题

来看产业端的大新闻

台积电预计今年第一季度利润同比暴涨百分之五十

连续第四个季度刷新记录

百分之五十的利润增长

这也太夸张了吧

台积电现在市值多少了

大约一点六八万亿美元

折合人民币超过十二万亿

要知道这是一家代工厂

就是帮别人生产芯片的

利润增长的核心驱动力就是两个字

Aai

具体是哪些ai 芯片在推动增长

是英伟达的gpu 吗

英伟达是大头

但不止

苹果的a 系列

高通的骁龙

还有各大科技巨头的定制ai 芯片

全都排着队找台积电代工

关键是台积电的三纳米制程和先进封装技术

目前全球没有替代品

需求已经超过了现有产能

客户基本上是求着台积电给排产能

这么说台积电是躺着赚钱

那对我们普通消费者来说

这意味着什么

Aa 芯片会不会继续涨价

短期内ai 芯片供不应求是确定的

价格肯定不会降

但从另一个角度看

台积电赚的越多

它就越有动力扩产

他们已经宣布了好几个新厂的建设计划

所以中期来看

二零二七

二零二八年产能上来之后

Ai 算力的价格会显著下降

等一下

你发现没有

这跟我们第一个话题是不是有关联

Gm 四能在手机上跑

某种程度上是在绕开gpu 的产能瓶颈

你不需要云端那么多gpu 了

用手机自己的芯片就行

米i 这个串联非常到位

端侧ai 和云端ai 其实在形成一个互补结构

简单任务下沉到终端

复杂任务还是走云端

这意味着即使gpu 产能紧张

Ai 的可用性也在通过端侧部署不断扩大

对投资者来说

台积电当然是确定性最高的标的之一

但端测ai 芯片的设计公司也值得关注

第三个话题

一个惨痛的教训

有人因为firebase 浏览器密钥没做限制

十三个小时内被刷掉了五万四千欧元

的german api 费用

这条在hn 上一百一十五分六十二条评论

什么

五万四千欧元

折合人民币四十多万

十三个小时

这是怎么做到的

非常典型的安全事故

开发者在前端代码里直接暴露了fie base 的api 密钥

而且这个密钥还绑定了geri 的api 调用权限

没有设任何调用频率限制和预算上限

有人发现了这个密钥之后

疯狂调用api 十三小时烧了五万四千欧

这谷歌不会自动发个警告吗

比如你的api 费用异常暴涨了一百倍这种

这就是问题所在

大部分云服务的计费告警都有延迟

而且默认配置通常是不够敏感的

你如果没有主动设置预算上限和告警阈值

平台不会帮你兜底

这在aws

Asir

Gcp 上都一样

所以这对开发者的教训是什么

特别是那些刚开始做ai 应用的独立开发者

三条铁律必须记住

第一

永远不要在前端代码里暴露api 密钥

用后端代理转发

第二

一定要设预算上限

Google cloud open ai 所有平台都支持

没事就是裸奔

第三

设置异常告警

调用量超过日常的三倍就该收到短信通知

说实话

这种事情挺吓人的

尤其对个人开发者来说

四十万基本上就是倾家荡产了

我好奇谷歌最终会不会减免这笔费用

历史上类似案例

云服务商有时候会酌情减免一部分

但这完全取决于对方的善意

没有任何保障

更深层的问题是

Ai 时代的api 调用成本比传统云服务高几个数量级

以前你的网站被d das

带宽费可能涨几百块

现在你的aai 接口被刷一晚上能烧几十万

整个行业需要更好的安全防护机制和成本控制工具

如果你是一个正在做ai 产品的开发者

现在立刻去检查你的api 密钥和预算设置

别等出事了再后悔

这真的是写的教训

第四个话题

来看ai agent 领域的一个重磅更新

Adobe 发布了firefly ai assistant

这不是一个普通的ai 助手

它是一个具备自主决策能力的智能体

Adobe 也搞agent 了

他们不是做photoshop 和视频编辑的吗

智能体在创意领域能干吗

这是一个非常重要的信号

Adobe 的这个firefly ai assistant 不是那种你说一句他做一部的简单ai 助手

你给他一个目标

比如帮我做一套品牌视觉方案

他会自己规划步骤

先分析你的品牌调性

然后生成配色方案

再设计logo 变体

最后排版到不同尺寸的模板上

全程不需要你一步步指导

哇

这不就是一个虚拟设计师吗

那专业设计师是不是要慌了

我觉得与其说是替代

不如说是重新定义设计师的工作方式

以前设计师百分之八十的时间在做重复性的执行工作

调大小

改配色

导出不同格式

现在这些全部交给agent 做

设计师可以把精力放在真正的创意决策上

这个跨印用编排的能力很有意思

它是不是能在photoshop 里做完图

自动丢到premier 里做视频

再丢到in design 里排版

没错

这正是adobe 的护城河所在

它拥有整个创意工作流的全家桶

从图像到视频到排版到pdf

所以它的agent 可以在这些应用之间无缝流转

这是open ai 和google 做不到的

因为他们没有这些专业工具

所以从趋势上看

Ai agent 的战场已经从通用对话转移到垂直行业了

完全正确

二零二六年的关键词就是垂直agent

通用聊天机器人的天花板很明显

真正能创造商业价值的是深度嵌入到具体工作流里的ai 智能体

Adobe 在创意领域

Dichop coo pilot 在编程领域

Boom berg 在金融领域

每个垂直赛道都会出现自己的agent 霸主

如果你是创业者

找一个还没有被ai agent 渗透的垂直领域

机会巨大

对普通用户来说

最直接的影响可能是你不需要学photoshop 了

直接告诉ai 你要什么

他帮你搞定

某种程度上是的

但我认为会分成两个市场

专业设计师用agent 来提升效率十倍

普通用户用agent 来完成以前做不了的设计任务

蛋糕会变大

而不是被分走

第五个话题

聊一个法律领域的里程碑事件

美国纽约南区联邦法院在usv hetner 案中裁定

跟ai 的聊天记录不受律师客户特权保护

Hn 上一百一十九分九十二条评论

等等

律师客户特权是什么意思

就是你跟律师说的话

不能被法院强制公开的那个保护

对

这是美国法律体系中最基本的原则之一

你跟你的律师之间的沟通是绝对保密的

法院不能强制你披露

但现在问题来了

如果你不是跟人类律师对话

而是跟一个ai 法律助手对话呢

法院受不受保护

那也就是说

你跟chat gpt 讨论的法律问题

检察官是可以拿来当证据的

正是如此

法院的逻辑是

律师客户特权的前提是你在跟一位有执照的律师沟通

Ai 不是律师

所以不适用这个特权

这个判例的影响非常深渊

这也太可怕了吧

现在多少人会跟ai 讨论各种敏感问题啊

税务规划

合同纠纷甚至刑事案件的情况

他们可能根本不知道这些对话可以被调出来

你说到点上了

这案件的核心教训是跟ai 说的每一句话都可能成为呈堂证供

特别是如果你用的是云端ai 服务

你的对话记录存在别人的服务器上

即使用的是端侧模型

如果你的设备被扣押

聊天记录一样可以被提取

这让我想到我们第一个话题说的端测ai

如果ai 在本地运行

至少数据不在云端

隐私好一点

但法院照样可以搜查你的手机啊

没错

端测aai 解决了传输层的隐私问题

但解决不了法律层面的问题

我预测这个判例会推动两个趋势

一是aai 法律产品会加入更醒目的免责声明

提醒用户对话不受特权保护

二是会催生新的合规工具

比如在你用aai 讨论敏感话题前

自动提醒你风险

对所有在用ai 处理法律相关事务的人来说

记住这条规则

把跟ai 的对话当成公开信息来对待

如果这句话你不愿意在法庭上被朗读出来

就不要跟ai 说

第六个话题

来看一个非常实用的开发者资源

微软开源了一个mcp 入门课程model context protocol for beginners

这是一个跨语言的教程

覆盖了dot net

Java

Type script

Python

Rest 等等

Mcp 这个概念最近真的到处都在说

但我感觉很多人其实还没搞清楚它到底是什么

能用大白话解释一下吗

简单说

Mcp 就是给aai 定义了一套标准接口

让aai 能够跟外部工具

数据库api 进行标准化交互

就像usbc 统一了充电接口一样

Mcp 统一了aai 跟外部世界对接的方式

以前每个ai 应用都要自己写一套对接代码

现在用mcp 就是即插即用

那微软出这个入门教程意味着什么

是不是说mcp 已经从概念阶段进入了大规模普及阶段

没错

当一个技术协议开始有大厂出官方教程覆盖六种编程语言的时候

就说明生态在加速成熟

微软这么做的目的很明确

他们希望更多开发者用mcp 来构建ai 应用

这些应用最终会跑在edge 上

给微软带来云计算收入

对开发者来说

现在学mcp 值得吗

还是说再等等看他会不会被淘汰

我的判断是

Mcp 在未来一两年内会成为ai 应用开发的标配技能

就像现在写api 要懂rest 一样

如果你是做ai 应用的开发者

现在学就对了

微软这个教程是免费开源的

起点很低

一个周末就能入门

这跟我们前面聊的adobe agent 其实有关联

Adobe 的firefly 能跨应用编排

底层很可能就需要类似mcp 这样的标准协议来打通不同工具之间的数据流

非常好的观察

Mcp 就是aai agent 时代的基础设施层

Agent 要自主完成任务

就需要调用各种工具

Mcp 给了这些工具一个统一的接口规范

所以说

学mcp 不是学一个具体技术

是在学ai 时代的通用语言

第七个话题

来看一条引发争议的消息

有人在hn 上问guesttime 这个服务是不是偷偷用用户的llm 额度来训练自己的模型

二百零二分九十六条评论

讨论相当激烈

这是什么意思

就是说你买了open ai 的api 额度

有个第三方工具在背后偷偷拿你的额度去为自己的模型

大致就是这个意思

用户发现gueas town 在处理请求的时候

实际消耗的token 数量远超预期

怀疑是在用户不知情的情况下额外发送了一些请求来收集数据或者改进自己的服务

这算不算偷

法律上怎么定义

这就是ai 时代的灰色地带了

很多中间件和代理服务在转发你的api 请求时确实有机会做手脚

比如多发几次请求来构建自己的数据集

或者缓存你的输入输出来训练模型

用户很难察觉

因为你只看到最终的账单

不知道中间发生了什么

这让我想到我们刚才说的firebase 密钥泄露

今天的话题好像有个共同主题

Ai 时代的信任和安全问题

密钥管理

Api 费用

数据隐私

哪个环节都可能出问题

你这个串联特别好

今天的几条新闻拼在一起看

就是一幅ai 安全的全景图

法律层面

Ai 对话不受特权保护

技术层面

Api 密钥泄露可以烧你四十万

商业层面

中间商可能偷用你的额度

这三个层面的风险叠加起来

对用ai 的个人和企业都是巨大挑战

对普通用户的建议是什么

不用ai 了吗

显然不可能

当然不是不用

而是要有安全意识

三个建议

第一

选择直接跟大模型厂商对接

减少中间环节

第二

定期检查你的api 调用量

看有没有异常

第三

对于敏感数据

优先考虑本地部署方案

信任

但要验证

这是ai 时代的基本素养

第八个话题

Open ai 的agents sdk 迎来了一次重大升级

这次更新加入了原生沙盒执行环境和模型

原生的测试套件

帮助开发者构建更安全的长期运行agent

沙盒执行环境是什么意思

就是给ai agent 套了一个笼子

比喻很到位

沙盒就是一个隔离的运行环境

Agent 可以在里面随便折腾

执行代码

读写文件

调用api

但他做的任何事情都不会影响外部系统

如果agent 出了bug 或者做了错误操作

损害被控制在沙盒内部

这解决了一个很核心的问题

你怎么信任一个会自主行动的aai

正是如此

之前做ai agent 最大的顾虑就是他要是搞砸了怎么办

万一他误删了数据库

万一他发了一封不该发的邮件

有了沙盒

你可以先让agent 在隔离环境里跑一遍

确认结果没问题再应用到正式环境

这跟传统软件开发里的测试环境和生产环境分离是一个思路吧

完全一样的逻辑

但技术挑战更大

传统软件的行为是确定性的

给同样的输入一定得到同样的输出

Ai agent 不是

他的行为具有随机性

你很难预测他在特定情况下会做什么

所以沙盒不仅要隔离

还要能录制agent 的全部行为轨迹

方便事后审计

你怎么看这次更新在整个agent 生态里的位置

是里程碑级别还是常规迭代

我认为是里程碑级别的沙盒执行解决了agent 落地最后一公里的信任问题

之前很多企业想用ai agent

但不敢部署

就是因为怕失控

有了标准化的沙盒方案

企业可以放心在生产环境中使用agent 了

我预判六个月内

基于open ai agent sdk 的企业级应用汇井喷

结合微软刚才的mcp 教程来看

Ai agent 的基础设施正在快速完善

Mcp 解决了工具对接问题

沙盒解决了安全运行问题

开发者的入场门槛确实在急剧降低

第九个话题

聊一个特别有意思的研究方向

Hagking face 上有一篇新论文叫memory transfer learning

研究的是编程agent 如何在不同任务领域之间迁移记忆

G

迁移就是说

一个ai 在做python 项目的时候学到的经验可以用在写javascript 的时候

差不多就是这个意思

现在的编程agent 最大的问题之一就是他在一个项目里积累的经验没办法迁移到另一个项目

你在a 项目里教了他很多架构偏好和代码风格

换到b 项目他又从零开始

这篇论文探索的就是怎么让agent 把一个领域的经验有效迁移到另一个领域

这不就是人类学习的方式吗

我学了骑自行车

学摩托车的时候就快很多

因为平衡杆是通用的

Ai 也能做到吗

你这个类比非常贴切

论文的核心发现是

编程agent 确实可以抽取一些跨领域通用的原知识

比如调试策略

代码组织原则

错误处理模式

这些原知识在不同编程语言和项目类型之间是可以迁移的

这对实际产品意味着什么

是不是说未来的co pilot 用的越久越聪明

而且在不同项目之间智慧是共享的

理想状态是这样

现在的co pilot 每个session 是独立的

没有长期记忆

如果记忆迁移学习成熟了

你的aai 编程助手会像一个真正的同事一样

他不仅记得你们之前项目的经验

还能把在别的团队学到的最佳实践带过来

哇

那真的就从工具变成同事了

不过这也有个隐私问题

如果一个agent 在a 公司学到的经验被带到b 公司

那不就是信息泄露吗

非常敏锐的问题

这就是记忆迁移研究必须解决的关键挑战

如何在保持知识通用性的同时

确保不泄露特定项目的敏感信息

可能的方案是指迁移抽象化的模式和策略

而不迁移具体的代码或数据

这个领域还很早期

但方向非常有前景

最后一个话题

谷歌发布了germany robotics e 二一点六

这是一个专门为机器人设计的大模型

Hn 上二百零五分六十八条评论

谷歌做机器人模型

这跟昨天我们聊的支援机器人有什么区别

区别很大

智源做的是硬件机器人加上控制软件

偏执行层

谷歌的germany robotics er 做的是更上层的

是让机器人能理解自然语言指令

感知环境

自主规划动作序列

简单说

智源造身体

谷歌造大脑

二是什么意思

Emergence response 吗

一

二代表embodied reasoning

也就是巨身推理

能在物理环境中进行推理和决策

这比纯文本aai 要难得多

因为机器人要理解三维空间物理定律

物体之间的关系

还要实时响应环境变化

一点六版本意味着迭代很快

从一点零到一点六

说明他们在快速推进

这个模型现在能做什么

根据论文和社区讨论

它能让机器人完成比较复杂的操作任务

比如理解把红色杯子放到架子上

这种多步骤的自然语言指令还能在遇到障碍时自动调整策略

关键突破在于泛化能力

不需要针对每个具体任务重新训练

这让我想到刚才说的巨身智能还没真正落地那条资讯

你觉得瓶颈到底在哪

是硬件不行还是ai 不够聪明

坦白说

两方面都有瓶颈

硬件方面

机器人的灵活性和可靠性还达不到工业级要求

Ai 方面

虽然germany robotics er 这样的模型进步很快

但在复杂环境中的鲁棒性还不够

一个人类觉得很简单的动作

比如从桌上拿起一个不规则形状的物体

对机器人来说仍然是巨大挑战

那你预测巨身智能大规模落地还需要多久

在受限环境中

比如工厂流水线

仓库物流

固定路线的配送

我认为两到三年就能看到大规模商用

但要做到像人一样在开放环境中自由操作

可能还需要五到十年

谷歌这个模型是在大脑层面推进速度

但身体层面还需要硬件厂商追上来

好了

今天的十个话题聊完了

米耶 你先来

今天最让你印象深刻的是哪条

我印象最深的是两条

一是gm 四在iphone 上跑这个事

这意味着ai 真的在从云端走向每个人的口袋

二是那个api 密钥泄露烧掉四十万的案例

太真实了

简直是恐怖故事

我觉得今天这几条新闻合在一起看有个大趋势

Ai 的能力在飞速下沉到终端

但安全和信任问题也在同步放大

我非常同意

我补充一点

今天adobe 的agent

微软的mcp 教程

Open ai 的沙盒sdk

这三条加在一起描绘的是ai agent 基础设施正在快速成熟的图景

协议层

工具层

安全层三块拼图正在同时补齐

我大胆说一句

二零二六年下半年

将是ai agent 应用的寒武纪大爆发

好了

今天的播客到这里

如果你喜欢我们的节目

记得分享给朋友

我们明天见

明天见

各位周末愉快

拜拜

展开显示全部歌词