December 4, 2025 · JustSayAI

更新于

AI大神Ilya最新访谈|中国“应试教育”报应在了美国模型上?

AI大神Ilya最新访谈|中国“应试教育”报应在了美国模型上?

你敢信吗?那个拿著奥数金牌、刷榜无敌的美国大模型,骨子里其实是个被“应试教育”毁掉的做题家。它为什么修不好一个简单的Bug?为什么改了A又坏了B?因为它根本就不懂什么是编程,它只是在疯狂地讨好出题人,本质上,这是一种被算法奖励的“作弊”。

中国乃至东亚最被人诟病的“应试教育”弊端,竟然极其讽刺地在美国最顶尖的AI模型上完成了闭环。

我们都在嘲笑只会刷题的书呆子,结果回头一看,这不就是现在的 LLM吗?Ilya Sutskever,这位曾经的大力出奇迹信徒,在他最新的访谈里直接撕开了这层遮羞布:如果不改变底层逻辑,Scaling Law(缩放定律)在通用模型上可能真的走到头了。

并不是“懂了”,只是“背过了”

Ilya 这次访谈的一个观点是关于“Reward Hacking”(奖励作弊)。为什么 AI 考试能拿满分,但在实际工程里是个废物?因为它所有的训练目标就是为了“通过考试”。

这就像一个刷了一万小时题库的所谓“学霸”,和一个只学了一百小时但真正理解原理的天才。前者知道所有标准答案,但只要题目稍微变个花样,它就崩了。目前的 AI 训练,本质上是在奖励这种“投机取巧”。它并没有建立起世界模型,它只是在概率的海洋里,拼命预测下一个能让你满意的 Token。这根本不是智能的涌现,这是“讨好型人格”的极致演绎。

没了“情绪”,AI 连袜子都穿不上

很多人还在意淫 AI 会产生自我意识,Ilya 却用一个神经科学的例子给我们泼了盆冷水:没有“情绪”或“价值函数”,智能就是个笑话。

想象一个脑部受损的病人,智力完好,四肢健全,但他早上起床会崩溃——因为他花了几个小时都决定不了该穿哪双袜子。为什么?人类之所以能秒做决定,是因为我们有“情绪(emotion)”,有偏好,有那个极其低功耗的“价值函数”。

现在的 AI 就是这个病人。它看似逻辑严密,实则患有严重的“选择困难症”。它没有直觉,没有喜恶,它给你输出答案不是因为它觉得这个“对”,而是因为它计算出这个答案最安全、最符合你的预期。一个没有“Gut Feeling”的智能,永远只能做人类的附庸,而不是伙伴。

通用模型的 Scaling Law 已死?

这可能是资本市场最不爱听的一句话,但我必须得说:通用大模型的 Scaling Law 可能真的结束了。

那个指望靠堆算力、堆数据、堆显卡就能通往 AGI的时代,正在落下帷幕。Ilya 曾经是 Scaling Law 的坚定鼓吹者,现在他却变身成了哲学家,开始谈论 System 2(慢思考)和 specialized models(专用模型)。这释放了一个极其危险的信号:大力不再出奇迹了。

但这不代表 AI 完了。恰恰相反,通用模型的黄昏,是专用模型的黎明。像特斯拉 FSD 这种垂直领域的 Scaling Law 才刚刚开始。未来不再属于那些试图做一个“全知全能神”的公司,而属于那些肯俯下身子,在医疗、法律、自动驾驶这些垂直领域里,把 AI 训练成顶尖专家的公司。

别把“工具”当“物种”

我们对 AI 最大的误解,就是总想把它塑造成人。我们给它起名“人工智能”,潜意识里就把它当成了人类智慧的某种延伸或模仿。

大错特错。AI 应该是一种完全平行的智慧形式。正如人类因为会使用工具而伟大,而不是因为会说话而伟大。我们总是痴迷于 AI 的语言能力,却忘了它本质上应该是我们大脑的“外挂”,而不是大脑的“克隆体”。

AGI 不应该是一个出厂即巅峰的成品,而应该是一个拥有极致学习能力的“学习者”。它不需要像人类一样有多愁善感,但它需要有从非确定性中寻找确定性的能力。我敢打赌,未来的 AI 绝不会长成我们现在想象的样子。它不会是一个有著人类弱点的硅基生命,而是一股在物理世界和数字世界穿梭的、甚至有些冷酷的效率洪流。

说到底,AI 现在的“智障”表现,不是因为它笨,而是因为我们人类太自恋,总想用我们那套蹩脚的“应试教育”去规训一个本该飞翔的物种。

这让我我想起庄子的一句话:

吾生也有涯,而知也无涯。以有涯随无涯,殆已!

GPT-6说自己是AGI,李飞飞和马斯克不服了!|聊聊GPT 6、世界模型、Cybercab谁才是AGI?
BLOG

GPT-6说自己是AGI,李飞飞和马斯克不服了!|聊聊GPT 6、世界模型、Cybercab谁才是AGI?

先来上一段暴论!我一直是硅谷最讨厌的“OpenAI 倒闭论”坚定倡导者。原本以为这次 GPT-6 和 Astra 憋出了什么惊天大招,但看完全部发布与实测,我不仅没看到所谓的通用人工智能,反而被硅谷巨头的画饼吃相给吓惨了!不仅 OpenAI 还在生死线上死撑,等上市狂欢过去后,我看 Anthropic 和 Claude 怕是更要直接爆雷。 放眼现在的硅谷,简直是一场群魔乱舞的集体疯魔。奥特曼拼命兜售他的“最强大脑”,李飞飞疯狂鼓吹她的“虚拟自习室”,马斯克则开着没有方向盘的铁壳子宣称搞出了“终极手脚”。每个人都指着自家的残次品嗷嗷叫着宣称 AGI 已来。可这到底是科技奇点,还是联合收割韭菜的超级骗局?今天我就把这三大神话彻底扒个底朝天! 屎上雕花的 GUI,被 Agent 扒了个精光 先聊聊掀起巨浪的 GPT-6 和 Astra。很多人盯着那几个基准跑分超过 Claude Fable 就高潮了,但那点微弱优势算个屁?这次真正引发地震的,是 Computer Use 和 ARC-AGI-3 指标。 什么叫 ARC-AGI-3?就是把 Agent 扔进完全

Jacob Chen·2026年9月9日
豆包到底能不能工作?产品老炮被AI骂垃圾,才发现是我不配!
BLOG

豆包到底能不能工作?产品老炮被AI骂垃圾,才发现是我不配!

豆包到底能不能工作?最近科技圈这个灵魂拷问,真的把我彻底整破防了,甚至可以说一记响亮耳光抽过来,把我吓惨了!在产品圈摸爬滚打十几年,我自以为是个懂业务的老炮。直到我把一套规范丢给豆包工作,结果被它反手一盆冰水浇透,我才承认一个残酷真相:不是豆包能不能工作,而是我根本不配! 大家想过没有,为什么市面上的 AI 办公工具,每个人用起来天差地别?大厂宣传 AI 能替代初级员工,你一上手却觉得它笨得像个智障?到底是大厂在忽悠人,还是我们自己的业务沉淀烂得不像样子? 100分的需求,AI反手打出10分羞辱 前些天我沉迷结对编程,琢磨着给团队减负。做过产品和技术管理的都知道,产品助理和项目经理绝对是组织里最吃力不讨好的脏活。在传统团队里,这种岗位天天被开发吐槽:啥也不懂,只会死催进度、日常买奶茶。要是真拿着死板规范去卡人,大家当场就能翻脸。 让豆包工作来接盘不正好吗?我花了一个小时,把自诩标准齐备的需求和看板权限全开给它,心里美滋滋地等着被夸奖。 结果现实狠狠给了我一拳!豆包像个毫无温度的冷面考官,反手甩出个耻辱数字:10分! 满分 100 分,它只打

Jacob Chen·2026年9月6日
AI办公这个垃圾赛道,大厂到底在抢什么?
BLOG

AI办公这个垃圾赛道,大厂到底在抢什么?

最近电梯里全是什么Work、什么Buddy的洗脑广告,千问办公、TraeWork、WorkBuddy这帮AI办公工具,正在把国内的三国杀打得头破血流。 但我开篇就要暴论一下:AI办公这个领域的竞争,基本上没有任何意义,这就是一个彻头彻尾的“垃圾赛道”!(至少在中国是) 但既然是垃圾赛道,为什么阿里、腾讯、字节甚至远在硅谷的谷歌,全都要疯狂砸钱抢地盘?难道真的是人性的沉沦? 如果你只把它当成一个卖给打工人的效率工具,那你连这盘棋的门槛都没摸到。 别装了,你们都是来烧Token的 有一件事情是绝对明确的:只要你把AI拉进办公场景,尤其是工作群聊,你的Token消耗量跟以前相比,绝对是呈指数级爆炸的。 以前AI是单聊,你问一句它答一句。现在AI进了群,它要干嘛?它要读上下文啊!不管它干没干活,群里几百条瞎扯淡的聊天记录、扯皮的会议纪要,它都得每一条嚼碎了咽下去,再吐出交付物。这消耗量比你一个人在那儿交豆包盯钓鱼要大出几十倍甚至上百倍! 大厂的云业务部门看着这疯狂飙升的消耗量,估计做梦都能笑醒:终于有傻子来海量烧Token了! 以前C端

JustSayAI·2026年8月21日