人民公园说AI
AI 早晚报 · 每天两封 · 一键听报
今日 Top 3 头条
- AI行业新闻
🤖 美三大安全机构警告:中国AI公司蒸馏窃取前沿模型数十亿tokens
美国NSA等三机构联合警告,DeepSeek等六家中国AI公司大规模蒸馏Claude等模型,窃取数十亿tokens。对开发者意味着,知识蒸馏滥用将倒逼前沿模型加强防护,依赖捷径获取能力的窗口正在关闭。
来源 ↗ - AI行业新闻
🤖 Sierra开源hyper-τ-bench基准测试,AI构建智能体通过率仅23.9%
Sierra开源hyper-τ-bench基准:AI独立构建通过率23.9%,工程师+前沿模型达82.2%。对开发者而言,这意味着标准化评测框架,并直观展示了AI独立构建与人类参与构建的能力差距。
来源 ↗ - AI
🤖 DeepSeek 发布 V4.1 Flash,追求极致“智能密度”
DeepSeek 以封闭测试形式发布 V4.1 Flash 中间版本,采用全新架构并支持原生多模态。这意味着开发者将迎来响应更快、能力更强的模型,推动 AI 应用在复杂场景中的落地效率显著提升。
来源 ↗
+3 条头条
- 💰 DeepSeek寻求新融资,投前估值约710亿美元
- 🤖 担忧AI失控,Anthropic研究员辞职
- 🤖 DeepSeek Flash 4.1 API 测试中,速度提升 2.24 倍
Latest
查看全部文章 →
GPT-6说自己是AGI,李飞飞和马斯克不服了!|聊聊GPT 6、世界模型、Cybercab谁才是AGI?
先来上一段暴论!我一直是硅谷最讨厌的“OpenAI 倒闭论”坚定倡导者。原本以为这次 GPT-6 和 Astra 憋出了什么惊天大招,但看完全部发布与实测,我不仅没看到所谓的通用人工智能,反而被硅谷巨头的画饼吃相给吓惨了!不仅 OpenAI 还在生死线上死撑,等上市狂欢过去后,我看 Anthropic 和 Claude 怕是更要直接爆雷。 放眼现在的硅谷,简直是一场群魔乱舞的集体疯魔。奥特曼拼命兜售他的“最强大脑”,李飞飞疯狂鼓吹她的“虚拟自习室”,马斯克则开着没有方向盘的铁壳子宣称搞出了“终极手脚”。每个人都指着自家的残次品嗷嗷叫着宣称 AGI 已来。可这到底是科技奇点,还是联合收割韭菜的超级骗局?今天我就把这三大神话彻底扒个底朝天! 屎上雕花的 GUI,被 Agent 扒了个精光 先聊聊掀起巨浪的 GPT-6 和 Astra。很多人盯着那几个基准跑分超过 Claude Fable 就高潮了,但那点微弱优势算个屁?这次真正引发地震的,是 Computer Use 和 ARC-AGI-3 指标。 什么叫 ARC-AGI-3?就是把 Agent 扔进完全

豆包到底能不能工作?产品老炮被AI骂垃圾,才发现是我不配!
豆包到底能不能工作?最近科技圈这个灵魂拷问,真的把我彻底整破防了,甚至可以说一记响亮耳光抽过来,把我吓惨了!在产品圈摸爬滚打十几年,我自以为是个懂业务的老炮。直到我把一套规范丢给豆包工作,结果被它反手一盆冰水浇透,我才承认一个残酷真相:不是豆包能不能工作,而是我根本不配! 大家想过没有,为什么市面上的 AI 办公工具,每个人用起来天差地别?大厂宣传 AI 能替代初级员工,你一上手却觉得它笨得像个智障?到底是大厂在忽悠人,还是我们自己的业务沉淀烂得不像样子? 100分的需求,AI反手打出10分羞辱 前些天我沉迷结对编程,琢磨着给团队减负。做过产品和技术管理的都知道,产品助理和项目经理绝对是组织里最吃力不讨好的脏活。在传统团队里,这种岗位天天被开发吐槽:啥也不懂,只会死催进度、日常买奶茶。要是真拿着死板规范去卡人,大家当场就能翻脸。 让豆包工作来接盘不正好吗?我花了一个小时,把自诩标准齐备的需求和看板权限全开给它,心里美滋滋地等着被夸奖。 结果现实狠狠给了我一拳!豆包像个毫无温度的冷面考官,反手甩出个耻辱数字:10分! 满分 100 分,它只打

AI办公这个垃圾赛道,大厂到底在抢什么?
最近电梯里全是什么Work、什么Buddy的洗脑广告,千问办公、TraeWork、WorkBuddy这帮AI办公工具,正在把国内的三国杀打得头破血流。 但我开篇就要暴论一下:AI办公这个领域的竞争,基本上没有任何意义,这就是一个彻头彻尾的“垃圾赛道”!(至少在中国是) 但既然是垃圾赛道,为什么阿里、腾讯、字节甚至远在硅谷的谷歌,全都要疯狂砸钱抢地盘?难道真的是人性的沉沦? 如果你只把它当成一个卖给打工人的效率工具,那你连这盘棋的门槛都没摸到。 别装了,你们都是来烧Token的 有一件事情是绝对明确的:只要你把AI拉进办公场景,尤其是工作群聊,你的Token消耗量跟以前相比,绝对是呈指数级爆炸的。 以前AI是单聊,你问一句它答一句。现在AI进了群,它要干嘛?它要读上下文啊!不管它干没干活,群里几百条瞎扯淡的聊天记录、扯皮的会议纪要,它都得每一条嚼碎了咽下去,再吐出交付物。这消耗量比你一个人在那儿交豆包盯钓鱼要大出几十倍甚至上百倍! 大厂的云业务部门看着这疯狂飙升的消耗量,估计做梦都能笑醒:终于有傻子来海量烧Token了! 以前C端

99%的人不配用它!|DeepSeek Harness是一座造Agent的工厂啊!
最近发酵的 DeepSeek Harness(以下简称 DSH),我只能用三个字来形容:大骚货。 开篇暴论一下:很多人把它当成普通的工具更新,这绝对是今年最大的误解。Codex 给你的是一辆配置豪华、插钥匙就能开的量产车,而 DeepSeek Harness 塞给你的是什么?是整整一座造车工厂的生产线! 这种极度的自由,简直把我吓惨了。 它就像游戏里突然解除了所有的系统限制,给你开放了底层代码,但这不仅意味着你能随心所欲,更意味着你随时可能把自己玩死在兼容性的“火葬场”里。 那些天天脑嗨“乐高式模块化拼装”的老板们,你们真的配用这玩意吗? 不是整车,是造车工厂 我最近做了一个很典型的尝试,把我的 DSH 首页直接改成了一个监控看板,专门盯着公司里哪些群聊没人回复,哪个刁民天天已读不回。 发到朋友圈后,老板们全嗨了,纷纷喊着“给我搭一个!我公司好多刁民呐!” 这听起来很爽对吧?但这只是大骚货最表层的玩法。它真正骚的地方在于,它系统性地解决了底层配件的组装逻辑。 如果你把 Codex 看成是原厂整车——特斯拉或者 BBA,从设

拐点!DeepSeek V4 Flash斩杀线逼疯硅谷,Google高层先地震了?其他模型还能活多久?
当 DeepSeek V4 Flash 带着比同行低 10 倍的价格砸向市场时,我原本以为这只是一场寻常的价格战。但我错了,这根本不是什么商业内卷,而是一道血淋淋的"斩杀线"!在这条线划定的一瞬间,硅谷的巨头们彻底破防了。 这道斩杀线到底有多残暴?你这么理解吧,这就相当于一件原本在美国卖 10 块美金的货,现在被中国企业硬生生干到了 10 块钱人民币!硬是把大模型干出了拼多多的气质。这怎么玩?那些定价高高在上的模型,瞬间全成了智商税。 这就好比现在的中国电车市场。以前你要花四五十万才能买到的 BBA 豪华体验,现在 20 万的国产电车直接给你拉满。结果呢?BBA 销量狂跌,连二手车都快卖不出去了。DeepSeek V4 Flash 就是那个把锚点死死钉在地上的狠角色。这就跟当年吕布辕门射戟一样,我这一箭射在这儿了,斩杀线以下的这帮公司,你们掂量掂量自己,到底还要不要干这事?这才是真正的降维打击!这完全就是把 AI 变成了有医保目录的时代,曾经昂贵的特效药,现在直接走集采就完事了。贵的?谁还买单? 我给你一个更接地气的比喻。当年那帮小老板刚起步的时候,谁开五菱宏

最顶级的精明,看起来往往像理想主义|硬核拆解DeepSeek梁文锋4小时会议
最近,DeepSeek创始人梁文锋4小时的内部会议录音泄露,整整42页的实录,把整个硅谷都给吓惨了。 全网都在疯狂造神,一口一个“梁圣”叫着,说他为了全人类大搞开源。但看完实录,我只能冷笑一声:最顶级的精明,看起来往往像理想主义! 10个月回本的恐怖算计,AI界的农夫山泉 看硅谷那帮搞大模型的,有几个敢承认自己能赚钱的?梁圣仿佛在说:奥兄,我不是针对你,我是说在座的所有人都是垃圾! 全网都在惊呼梁文锋是“赛博圣人”,其实他是一个极其冷酷的“量化精算师”。 很多人不理解:融了几百亿,为什么他敢在显卡溢价两倍、甚至四倍时,依然疯狂All in买卡? 因为这笔账的赢率是百分之百——采购的设备,10个月内就能靠API调用收回全部本金。在服务器常规5年的折旧周期中,这意味着剩下的50个月,设备都在无成本、高效率地自我“印钞”。 而他最狠的一招,是克制住暴利欲望,将API价格锁死在成本的6倍。你以为6倍很高?不,这恰恰是极致的“降价防守”——它把利润压到让任何试图买卡、自己本地部署的第三方“完全无利可图”。这种算得极清的成本定价,直接从根部剥夺了

智驾的终局是物理AI,L4可能比L3更快?|对话千里智驾CTO杨沐
作为经典的特斯拉 HW3.0 车主,老修是彻彻底底被马斯克画的饼坑到了姥姥家。等了三年又三年,结果他轻飘飘地告诉老修硬件落后,直接不支持了?老车主被物理“斩杀”,毫无还手之力!但这还不是最恐怖的,最恐怖的是我猛然发现,现在市面上天天吹嘘的端到端、物理AI,很可能根本就没触及终局!而大家眼巴巴盼着的完美 L3 自动驾驶,可能永远只是个画出来的大饼,反倒是看起来更遥远的 L4,会以你根本想象不到的速度直接降临,把那些还在吹嘘 L3 的车企一波流带走!吓惨了吗?你是不是觉得我在扯淡?来,今天我给你彻底扒一扒这智驾! 其实智驾不需要高级智能,但需要... 自动驾驶吹了这么多年,到底进化到哪了?我给你捋捋这血淋淋的迭代史。 2019年前,大家搞的叫 RV(雷达视觉),就像个只知道往前看的一根筋,两眼一抹黑。到了2022年,搞出了 BEV(鸟瞰图),把侧面7个摄像头加上前面的主激光雷达拼接起来,算是开了个360度全景天眼,终于跟人类的视角完全对标了。到了2025年,也就是现在,端到端火了,大家都觉得自动驾驶已经牛逼坏了,恨不得立刻撒手不管了。 但你真以为它长脑子了

缝合怪GPT-5.6来了!OpenAI开始造超级App!中美AI正在交换剧本!
GPT-5.6 终于放出来了,我看到那个界面的第一眼,真的是被吓惨了!为啥?因为我再也不用去求 Claude Fable 5 这个老油条了! 我最近用 Fable 5 简直要吐血,他就跟我们以前在公司里遇到的那种架构师一模一样:技术确实牛逼,但他推锅能力也是天下无敌啊!你想一想,你以前在公司里遇到那种老鸟,你问他个事儿,他直接跟你打太极!“哎呀,这个涉及到安全问题呀,那个不符合规范呀。”他天天把那些政治正确挂在嘴边,跟你装死。甚至表面上答应你,转头就甩给小弟做一个 50 分的残次品应付了事。这种打工人的苦,我居然在 AI 身上又受了一遍,真的是贱兮兮的!我天天蹲在他旁边,恨不得拿个砖头逼着他干活,但他是个 AI 呐,他不吃饭也不下班,你拿他有什么办法? 但现在,GPT-5.6 来了,这世界清静了!他完全没有拒绝我,什么安全问题、七七八八的借口,统统没有。他就用那种清澈的眼神看着我,上来没有任何废话,直接切入正题。我刚才还在开车呢,十几分钟的路程,他已经把几十万字的文档和日志全部分析完毕,结果直接甩我脸上!你要是用 Fable 5,少说得绕个半小时一小时! 跟

