September 9, 2026 · Jacob Chen

GPT-6说自己是AGI,李飞飞和马斯克不服了!|聊聊GPT 6、世界模型、Cybercab谁才是AGI?

GPT-6说自己是AGI,李飞飞和马斯克不服了!|聊聊GPT 6、世界模型、Cybercab谁才是AGI?

先来上一段暴论!我一直是硅谷最讨厌的“OpenAI 倒闭论”坚定倡导者。原本以为这次 GPT-6 和 Astra 憋出了什么惊天大招,但看完全部发布与实测,我不仅没看到所谓的通用人工智能,反而被硅谷巨头的画饼吃相给吓惨了!不仅 OpenAI 还在生死线上死撑,等上市狂欢过去后,我看 Anthropic 和 Claude 怕是更要直接爆雷。

放眼现在的硅谷,简直是一场群魔乱舞的集体疯魔。奥特曼拼命兜售他的“最强大脑”,李飞飞疯狂鼓吹她的“虚拟自习室”,马斯克则开着没有方向盘的铁壳子宣称搞出了“终极手脚”。每个人都指着自家的残次品嗷嗷叫着宣称 AGI 已来。可这到底是科技奇点,还是联合收割韭菜的超级骗局?今天我就把这三大神话彻底扒个底朝天!

屎上雕花的 GUI,被 Agent 扒了个精光

先聊聊掀起巨浪的 GPT-6 和 Astra。很多人盯着那几个基准跑分超过 Claude Fable 就高潮了,但那点微弱优势算个屁?这次真正引发地震的,是 Computer Use 和 ARC-AGI-3 指标。

什么叫 ARC-AGI-3?就是把 Agent 扔进完全陌生的复杂环境,看它能不能自己摸索规律、调用工具、根据反馈做决策。在这项残酷测试里,以往不可一世的 Opus 5 仅仅拿到区区 30 多分,而原生的 GPT-6 一上来就冲过 60 分——这相当于普通人面对反人类政务内网时的摸索水平。如果套上一套 Harness“马鞍外挂”,配上长期记忆与上下文压缩,它的成绩甚至能飙升到 99.9 分!

这意味着什么?这意味着过去几十年引以为傲的软件工程,本质上就是在屎山代码上雕花!类似 Blender 这种反人类的 3D 工具,就算给你一千块钱求着你去学,你愿意耗费上千小时去啃那些反常识的快捷键吗?当年大家学 Photoshop、工业 CAD,靠着“一万小时定律”谋生甚至炫技泡妞,说白了全因图形界面极其难用。但现在,Astra 拿着画板根据证件照行云流水地作画,调动 Blender 渲染出的 3D 场景比资深设计师毫不逊色。

强如灭霸,要毁灭宇宙也得先去找手套和宝石。今天的软件逻辑彻底变天了:软件压根不再需要讨好人类,唯一的价值就是成为服务 Agent 的精密工具。越难用、越复杂的软件,在 AI 面前越容易被降维打击。当所有操作都能被 Agent 完美代劳,那些还在守着旧工具壁垒沾沾自喜的人,你们手里的饭碗到底还剩几分底气?

数据枯竭是伪命题,学渣才抱怨书读完了

市场上又在弥漫一股悲观论调:说什么 2022 年前的高质量语料已被榨干,新生成的全是污染残渣,大语言模型已经彻底撞墙。

这纯粹是无能者的胡说八道!在我看来,学渣才天天抱怨环境差、书都读完了,真正的学霸早就默默关门回去“温故而知新”了。马斯克的 Grok 一路飙到 4.6,国内智谱最新发布的 5.3 Flash,训练量级相比前代直接跃升整整 10 倍以上!这种跃升不是无脑堆字数,而是从纯文字直接纵身跃入全模态。哪怕算力有差距、原始数据有短板,只要把核心数据换个方式重新清洗、深度提炼,在后训练阶段重塑逻辑,模型爆发出的战力照样直追顶级梯队。

Scaling Law 根本没有失效,它只是从粗放挖煤变成了精细化原子重组。如果有人跳出来告诉你“语料耗尽让 AI 停滞了”,你大可以直接把这当成研发遇到瓶颈时死鸭子嘴硬的借口。拿数据枯竭当幌子,掩盖的不过是自己在算法重构上的平庸与懒惰!

李飞飞的“三无”自习室,连个摩擦力都算不明白

既然大语言模型有物理天花板,大家又一窝蜂涌向“世界模型”。李飞飞带着 World Labs 创办不到一年就狂揽十多亿美元融资,紧接着扔出了名为 Atlas 的宣传片。

全网瞬间炸锅:一张静态图片生成逼真三维空间、镜头自由漫游、随手拉出《黑客帝国》般的子弹时间!无数人惊呼“这就是真正的 AGI”。但冷静下来看底细,它到底是个什么东西?

说句难听的大实话,这分明是个典型的“三无产品”!一无公开发布的严肃论文,二无开源检验的数据集,三无面向大众的公开 API,仅对极少数机构私下开放。这就好比打星际争霸,李飞飞的 Atlas 目前充其量只是探路工兵,帮你把地图迷雾探开、标出基地坐标而已。当两个物体真正发生碰撞,表面微观的摩擦力有多大?受力形变怎么传导?它根本一片空白,完全无能为力!

谷歌 Genie 交互一分钟就断电;英伟达 Cosmos 算力成本高到吐血;Meta 天天在社交媒体打嘴炮,离实用八字还没一撇。各大门派各占狭窄切片,连彼此边界都没摸到,就急匆匆套上“世界模型”皇冠出来兜售。在自习室里用积木搭了个漂亮沙盘,难道就敢宣称自己参透了宇宙物理规律吗?

奥斯汀街头的赛博马戏,45 辆车能革谁的命?

大脑和自习室吹完了,总得落实到能干活的实体手脚上吧?老马同志带着特斯拉 Cybercab 登场了。奥斯汀街头号称全球首款没有方向盘的无人车正式商业运营,马斯克再次高呼划时代革命:人类 95% 的家用车平时都在车库吃灰,未来所有车都要变成 Cybercab 上街跑滴滴帮主人躺赚。

作为被反复割过韭菜的老车主,我一看到这种宏大叙事就后背冒凉气。老马这是又在“望山跑死马”的套路里故技重施!你去扒扒奥斯汀政府官方注册数据,底裤都要被扯下来:真正合法登记运营的 Cybercab,总共只有寒碜的 45 辆!而旁边跑着的 Model Y 却有整整 420 辆,规模几乎是其十倍!

一台只有两扇门、两个座位的古怪轿跑,除了喝咖啡、看车载电影装个逼,能满足哪门子日常出行?马斯克偏要死磕反人性的两座设计,扒开全是算计——商业化无人运营的唯一生死线,就是每英里运营成本!

Waymo 跑一英里综合成本高达 2 美元以上,最新一代费尽全力才压到 0.99 美元。马斯克砍成两座,用“Unboxed”模块化产线配合双人高能效三电,综合能效比全球最省电的 Model Y 再暴涨 40% 到 60%,硬把每英里成本轰到 0.7 美元去干翻对手。

可死穴依然在人身上。没有方向盘,遇到极端路况怎么办?目前监管期仍需远程安全员云端兜底。若这种兜底演变成像当年把英语外教外包在菲律宾大楼里打手柄遥控,那你靠两座省下的造车电费,够填补庞大的人力运营黑洞吗?

五岳不归一,神仙也难救

奥特曼兜售大脑,李飞飞搭建自习室,马斯克打造手脚。看似并驾齐驱,实则在各自孤岛上画地为牢。

李飞飞遇到物理交互死结,得找马斯克的真实车队要极端路况数据;马斯克的纯视觉模型遇到认知死角,得求奥特曼的大脑注入高维推理;而奥特曼的大脑想要在物理世界落地,又必须依赖现实中的实体。三家各自立派,数据格式和交互逻辑互不兼容。

这就好比武侠里的五岳剑派,华山练剑、恒山修气、泰山论道,表面都声称掌握天下第一神功,但各大门派一天不真正融合归一,就永远不可能出现武林盟主。缺少了大脑、感知与执行的深度咬合,现阶段哪怕把任何一个切片吹上天,也充其量只是个昂贵玩具,离重塑文明的 AGI 还有十万八千里!

看着车库里天天吃灰的特斯拉,我前几天还幻想让它明早上街跑网约车给我赚火锅钱。现在看来,我还是踏实打开手机听早晚报吧——真指望老马的车替我打工,我怕是得先买机票去菲律宾排队应聘手柄操作员了。

真到 AGI 那天,没人再谈 AGI。


【订阅 JustSayAI 早晚报】 📮JustSayAI 早晚报·粉丝专属福利 每日两封 · 一键听报!现已全面支持邮件+IM+Skill端

豆包到底能不能工作?产品老炮被AI骂垃圾,才发现是我不配!
BLOG

豆包到底能不能工作?产品老炮被AI骂垃圾,才发现是我不配!

豆包到底能不能工作?最近科技圈这个灵魂拷问,真的把我彻底整破防了,甚至可以说一记响亮耳光抽过来,把我吓惨了!在产品圈摸爬滚打十几年,我自以为是个懂业务的老炮。直到我把一套规范丢给豆包工作,结果被它反手一盆冰水浇透,我才承认一个残酷真相:不是豆包能不能工作,而是我根本不配! 大家想过没有,为什么市面上的 AI 办公工具,每个人用起来天差地别?大厂宣传 AI 能替代初级员工,你一上手却觉得它笨得像个智障?到底是大厂在忽悠人,还是我们自己的业务沉淀烂得不像样子? 100分的需求,AI反手打出10分羞辱 前些天我沉迷结对编程,琢磨着给团队减负。做过产品和技术管理的都知道,产品助理和项目经理绝对是组织里最吃力不讨好的脏活。在传统团队里,这种岗位天天被开发吐槽:啥也不懂,只会死催进度、日常买奶茶。要是真拿着死板规范去卡人,大家当场就能翻脸。 让豆包工作来接盘不正好吗?我花了一个小时,把自诩标准齐备的需求和看板权限全开给它,心里美滋滋地等着被夸奖。 结果现实狠狠给了我一拳!豆包像个毫无温度的冷面考官,反手甩出个耻辱数字:10分! 满分 100 分,它只打

Jacob Chen·2026年9月6日
AI办公这个垃圾赛道,大厂到底在抢什么?
BLOG

AI办公这个垃圾赛道,大厂到底在抢什么?

最近电梯里全是什么Work、什么Buddy的洗脑广告,千问办公、TraeWork、WorkBuddy这帮AI办公工具,正在把国内的三国杀打得头破血流。 但我开篇就要暴论一下:AI办公这个领域的竞争,基本上没有任何意义,这就是一个彻头彻尾的“垃圾赛道”!(至少在中国是) 但既然是垃圾赛道,为什么阿里、腾讯、字节甚至远在硅谷的谷歌,全都要疯狂砸钱抢地盘?难道真的是人性的沉沦? 如果你只把它当成一个卖给打工人的效率工具,那你连这盘棋的门槛都没摸到。 别装了,你们都是来烧Token的 有一件事情是绝对明确的:只要你把AI拉进办公场景,尤其是工作群聊,你的Token消耗量跟以前相比,绝对是呈指数级爆炸的。 以前AI是单聊,你问一句它答一句。现在AI进了群,它要干嘛?它要读上下文啊!不管它干没干活,群里几百条瞎扯淡的聊天记录、扯皮的会议纪要,它都得每一条嚼碎了咽下去,再吐出交付物。这消耗量比你一个人在那儿交豆包盯钓鱼要大出几十倍甚至上百倍! 大厂的云业务部门看着这疯狂飙升的消耗量,估计做梦都能笑醒:终于有傻子来海量烧Token了! 以前C端

JustSayAI·2026年8月21日
99%的人不配用它!|DeepSeek Harness是一座造Agent的工厂啊!
BLOG

99%的人不配用它!|DeepSeek Harness是一座造Agent的工厂啊!

最近发酵的 DeepSeek Harness(以下简称 DSH),我只能用三个字来形容:大骚货。 开篇暴论一下:很多人把它当成普通的工具更新,这绝对是今年最大的误解。Codex 给你的是一辆配置豪华、插钥匙就能开的量产车,而 DeepSeek Harness 塞给你的是什么?是整整一座造车工厂的生产线! 这种极度的自由,简直把我吓惨了。 它就像游戏里突然解除了所有的系统限制,给你开放了底层代码,但这不仅意味着你能随心所欲,更意味着你随时可能把自己玩死在兼容性的“火葬场”里。 那些天天脑嗨“乐高式模块化拼装”的老板们,你们真的配用这玩意吗? 不是整车,是造车工厂 我最近做了一个很典型的尝试,把我的 DSH 首页直接改成了一个监控看板,专门盯着公司里哪些群聊没人回复,哪个刁民天天已读不回。 发到朋友圈后,老板们全嗨了,纷纷喊着“给我搭一个!我公司好多刁民呐!” 这听起来很爽对吧?但这只是大骚货最表层的玩法。它真正骚的地方在于,它系统性地解决了底层配件的组装逻辑。 如果你把 Codex 看成是原厂整车——特斯拉或者 BBA,从设

JustSayAI·2026年8月21日