【AI星球日报】2026-08-26 | 算力王座松动:OpenAI"16个月造芯"超越英伟达,端云两侧同时变天
今日焦点深度解读
【趋势洞察】AI公司开始自己造芯:OpenAI用16个月流片出超越英伟达Blackwell的Jalape?o,苹果M6/M5 Ultra补齐端侧算力——算力不再只是"买来的",正成为"造出来"的护城河
事件简述
就在昨天,两则重磅消息几乎同时引爆。一是OpenAI在Hot Chips大会正式公开自研推理芯片"Jalape?o":从设计到流片仅16个月,SemiAnalysis实测其单位功耗吞吐全面超越英伟达Blackwell,甚至单并发下跑DeepSeek R1能冲到每秒700 tokens。二是苹果发布2nm制程的M6与新旗舰M5 Ultra:M6首次采用12核CPU+双16核神经网络引擎,M5 Ultra用四Die封装把统一内存带宽拉到1.2TB/s,专为"本地跑大模型"而来。
第一层:是什么?
先拆开这两个信号的技术本质。
- Jalape?o不是"定制怪兽",而是"通用推理芯片"。 很多人以为OpenAI做的是只服务自家模型的专用芯片,SemiAnalysis实测反驳了这点:它是通用AI推理芯片,能跑各种开源模型和通用推理负载。它靠的是"软件硬件协同设计",在几乎所有场景的功耗性能比上都压过Blackwell,且不依赖投机解码、不拆分预填充/解码。最震撼的是:AI正在反过来加速芯片设计——16个月的极短流片周期本身就是证据。
- 苹果M6/M5 Ultra在端侧"堆AI算力"。 M6用2nm工艺堆出双16核神经引擎与12核GPU,目标是把更强的AI推理放进Mac mini;M5 Ultra则用四Die封装把带宽做到1.2TB/s,256GB统一内存意味着"本地能装的大模型又大了一圈"。苹果的策略很清晰:把端侧推理做成桌面级生产力,让"本地私有化跑大模型"不再只是发烧友玩法。
第二层:为什么重要?
信号一:算力格局正在从"一家独大"走向"多极分化"。 英伟达靠GPU生态几乎垄断了训练与推理市场,还传出芯片要涨价17%。如今OpenAI靠"芯片+软件协同设计"在推理功耗比上反超,等于宣告"AI公司不再甘当英伟达的买单者"。训练端仍是英伟达主场,但推理端(恰恰是每天被调用的部分)正在成为新技术入场的主战场。
信号二:AI公司造芯 = 把"算力"从成本项变成战略资产。 当推理成本能因自研芯片下降一个量级,谁能自造芯,谁就能用更低的边际成本支撑更大规模的免费/低价AI服务,进而虹吸更多用户和数据,形成新的飞轮。这对中小团队意味着:与大厂比"谁的模型聪明"越来越难,但比"谁的算力更便宜"更难。
信号三:端侧AI算力进入"生产力级"。 苹果把"能装大模型的桌面算力"做成标准配置,配合支持简体中文的Apple Intelligence,本地推理的体验门槛正在降低。对普通用户和中小团队,一个"数据不出本机、离线也能跑、隐私可控"的AI工作台,正从设想变成可落地的现实。
第三层:我们的机会
- 给AI应用开发者:推理算力成本的松动,意味着"高频调用+低价甚至免费"的产品模型有了更大的设计空间。值得重新核算:过去因算力成本被砍掉的"每次对话都跑大模型"的功能,现在是否值得重新做一遍。
- 给重度AI使用者:苹果M5 Ultra 256GB统一内存,是一条"本地私有化跑开源大模型"的可行路径。如果你的工作涉及敏感数据(合同、代码库、客户资料),一台本地算力设备能帮你把推理"留在本机"。
- 给关注供应链的人:留意"AI加速芯片设计"这条隐秘暗线。造芯周期从几年压缩到16个月,意味着后续自研芯片的AI公司会继续涌现,整个芯片产业链的竞争逻辑都在被改写。
延伸思考
当OpenAI、苹果都开始"自造算力",一个尖锐的问题摆在眼前:算力正在从"外购能力"变成"内建壁垒",那我们这些不造芯的普通团队和个人,在这轮变局里真正的护城河是什么? 是更懂业务场景的应用、更丝滑的工作流,还是更深的用户关系?值得每个人仔细想想。
高价值应用拆解
【实战工具箱】用"本地大模型+私密文档"搭建你的离线AI工作台:让敏感数据不出本机,推理又快又安全
场景锚定
适用于:法务、财务、研发、医疗、咨询等处理敏感信息的从业者,以及所有对"把数据喂给云端AI"有顾虑的人。核心场景是:过去你不敢把合同、代码、客户名单发给云端大模型,只能人工处理。如今借助新一代端侧算力(如苹果M5 Ultra、或高内存PC/Mac),你能在本地跑起一个专用大模型,让数据全程不出设备。
方法步骤
1. 确认算力够不够:本地跑7B-13B参数模型,建议内存≥32GB;想跑更大的(70B+量化)则争取48-256GB统一内存设备。内存带宽越高,出词越快。
2. 选一个本地推理工具:主流可选 Ollama / LM Studio / llama.cpp。它们都支持一键下载开源模型并本地启动,无需联网也可用。
3. 按场景挑模型:中文偏问答/写作,用 Qwen 系列;英文+代码,用 DeepSeek、Llama 或 Phi 系列。拿不准就从"更小但更快"的开始。
4. 把工作流搬进来:把常用提示词模板、私有知识库(用RAG或直接把文档放进上下文)配置好,让本地模型针对你的专属场景回答。
5. 建立"本地优先、云端兜底"习惯:敏感/隐私任务→本地;需要最新知识或超强能力的复杂任务→再上云端。既保安全又兼顾效果。
原理与变体
原理:新一代端侧芯片的杀手锏是"大统一内存带宽+大容量统一内存"。模型推理是"内存带宽饥饿型"任务——带宽越高、显存越大,能跑的模型越大、出词越快。苹果把带宽做到1.2TB/s,正是把"本地推理的体验"推到接近云端的水平。
变体思路:
- 离线知识库问答:把内部规章制度、技术文档喂给本地模型,做成"不出网的专属客服"。
- 本地代码辅助:在隔离环境跑代码审查、重构建议,敏感代码库不再外发。
- 多电脑协同:工作机跑"本地小模型"做日常杂活,需要时再连云端大模型做重活,成本与安全两全。
效果预览
想象这样一个场景:你把公司的NDA合同、核心代码库、财务模板全部交给本地模型,你可以放心地对它说"帮我把这份合同里对我方不利的条款标出来"或"用我们的技术栈重写这段老代码"——所有数据全程留在你的设备里,不经过任何第三方服务器。既享受了大模型的效率,又守住了商业秘密的底线。这正是端侧算力突破给普通人带来的最实在的价值。
星友互动
今天聊到"OpenAI自研芯片反超英伟达"和"苹果把本地算力做成生产力"。想问问大家:在日常工作和生活中,有哪些任务你因为"怕数据泄露"而至今不敢用AI的? 是敏感合同、内部代码,还是客户资料、个人隐私?如果本地算力能彻底解决"数据不出本机"的顾虑,你最想第一个拿来做什么?欢迎在评论区聊聊你的"不敢用AI"清单,以及你对"AI公司自己造芯抢英伟达生意"的看法。
——
IT老傅 | 坐标北京 | 近30年软件行业老兵 | 17年创业经历
核心业务:
1. AI培训与咨询 —— 帮个人和企业用好AI(让天下没有难用的AI)
2. 软件定制开发 —— 从AI应用到企业系统(AI重造业务)
正在做的事:
· 运营「AI应用模式探索」知识星球,每天分享能落地的AI玩法
· 打造AI工作流系统,让个人和中小企业也能用上AI
想了解更多AI应用模式和实操落地方法?
欢迎加入我的知识星球「AI应用模式探索」
知识星球链接:https://wx.zsxq.com/group/88511145421842
关注我,一起用AI提升效率、创造价值!
微信公众号:神州共赢 | IT老傅聊AI
抖音|快手|视频号|小红书:IT老傅聊AI |