智駕的終局是物理AI,L4可能比L3更快?|對話千里智駕CTO楊沐

作為經典的特斯拉 HW3.0 車主,老修是徹徹底底被馬斯克畫的餅坑到了姥姥家。等了三年又三年,結果他輕飄飄地告訴老修硬件落後,直接不支持了?老車主被物理“斬殺”,毫無還手之力!但這還不是最恐怖的,最恐怖的是我猛然發現,現在市面上天天吹噓的端到端、物理AI,很可能根本就沒觸及終局!而大家眼巴巴盼著的完美 L3 自動駕駛,可能永遠只是個畫出來的大餅,反倒是看起來更遙遠的 L4,會以你根本想象不到的速度直接降臨,把那些還在吹噓 L3 的車企一波流帶走!嚇慘了嗎?你是不是覺得我在扯淡?來,今天我給你徹底扒一扒這智駕!
其實智駕不需要高級智能,但需要...
自動駕駛吹了這麼多年,到底進化到哪了?我給你捋捋這血淋淋的迭代史。
2019年前,大家搞的叫 RV(雷達視覺),就像個只知道往前看的一根筋,兩眼一抹黑。到了2022年,搞出了 BEV(鳥瞰圖),把側面7個攝像頭加上前面的主激光雷達拼接起來,算是開了個360度全景天眼,終於跟人類的視角完全對標了。到了2025年,也就是現在,端到端火了,大家都覺得自動駕駛已經牛逼壞了,恨不得立刻撒手不管了。
但你真以為它長腦子了?扯淡!
現在的端到端方案,頂多算是個四肢發達、小腦長好了的“弱智”!什麼意思?這就好比,小腦能幫你維持平衡、躲避障礙,把運動神經拉滿了。但它懂什麼是“江湖規矩”嗎?
來個水坑,路中間長了個奇形怪狀的石柱,突然竄出來一群動物,它能認出來嗎?你遇到窄道匯入、遇到叉車加塞、極窄路段會車,老司機是怎麼幹的?老司機是靠察言觀色!看前車輪胎稍微轉了個30度,看對方司機手伸出來比劃了一下,甚至隔著玻璃看他眼神不對做個示意,就知道這孫子要插隊。這叫什麼?這叫因果關係推理!
而現在的智駕懂個屁的因果推理啊?它的底層邏輯就是模仿學習,它的本質就是在不帶任何智商的前提下,去嘗試擬合你的行為,這就是一種死板的概率分佈修正。它根本沒有因果推理能力,遇到這種複雜的交互博弈,立刻就得抓瞎!所以說,現在的自動駕駛,小腦是發育好了,但智商還停留在3歲,現在必須得給它瘋狂“雞娃”,把智商硬拔到10歲才行!
世界模型和 VLA?那就是給司機配個“神級領航員”
那到底怎麼給這三歲的弱智雞娃?難道給它塞個愛因斯坦的大腦進去嗎?
最近大家都在吹什麼“世界模型”、“VLA(視覺-語言-動作模型)”,聽得耳朵都起繭子了,覺得這玩意離我們普通老百姓十萬八千里。其實戳破了窗戶紙,根本沒那麼玄乎!
世界模型是個啥?它就是提出,必須用一種稠密的特徵來表徵這個世界。我不管你後續怎麼處理,我必須先把這個世界的一草一木、風吹草動都清清楚楚地編碼進系統裡,它就是一個完美的仿真器。
那 VLA 呢?就是想用大模型(LLM)的思維鏈能力,來彌補自動駕駛最缺乏的邏輯推理。
你以為物理 AI 就是一個超級模型解決所有問題嗎?你以為它是一個神仙,能把所有事情全包了?做夢呢!
這事兒的本質,相當於車子本身是一個底層的“司機”,專門負責踩油門和剎車;而大模型,就是坐在副駕駛的一個“神級領航員”。
常規路況下,司機自己開就行了;一旦遇到搞不定的神仙路況,司機直接轉頭問領航員:“大哥,前面這孫子想加塞,我咋辦?”這時候,領航員靠著世界模型的理解和大模型的因果推理,瞬間給出一個最優解。大家提世界模型也好,提VLA也好,本質就是怎麼把這兩個已經存在於大模型的能力,引入到現在的自駕基礎範式裡,我不讓既有能力回退,同時我又具備了新的推理能力。
別看現在很多大模型的 Demo 演示的時候像個下凡的仙女小龍女,一到你手裡就變成了買家秀的賈玲。為啥?因為如果你的基礎模型(基模)能力太差,沒有那些自駕的數據底子,你後期再怎麼做後處理(Post-training),它的上限都極其可憐!你連最基本的路況都識別不對,你還指望它能推理?
特斯拉在國內?可能連個車位都搶不到!
說到這,我知道肯定有人又要跪舔特斯拉了。確實,特斯拉 FSD 在北美,從第一性原理來看,那絕對是世界級的第一梯隊,無可厚非。
但它一旦到了國內呢?說句難聽的,它可能連個老頭樂都躲不開!這是為什麼?
因為特斯拉那套端到端能牛逼,是靠全北美乃至全世界的海量數據喂出來的。你每踩一腳剎車,每次亂轉一下方向盤,數據都能瞬間迴流給它訓練。
但你到了國內,能這麼玩嗎?第一,很多敏感地方你根本進不去,必須得隔離。第二,它的數據收集面臨極大的圖商資質等法規阻礙。
更致命的是,它只能從自己的車主身上收集數據。而像老修這種被淘汰的 HW3.0 老車主,我們的老車根本無法給它的新模型提供任何幫助!它想要在國內實現從0到1的數據循環閉環?抱歉!
200B 的大模型?你調的可能只是個“小老弟”
這時候你肯定要倒吸一口涼氣了:給車裝上這麼牛逼的世界模型、物理大腦,這車的硬件成本不得上天啊?這車我這輩子還買得起嗎?是不是得賣我幾百萬?
你這也太小看資本家精打細算的刀法了!
我問你,你以為你現在調用的那些號稱 200B(兩千億參數)的雲端大模型,每一次都是那個超級大腦在親力親為地回覆你嗎?
別做夢了!平時你問個“今天天氣咋樣”,後臺直接扔個 5B 的小模型,像打發要飯的一樣就把你打發了。只有當你急眼了開始罵人,或者扔給它一道微積分的高級題,它後臺識別到你需要高級智商了,才會真正去調用那個 200B 的龐然大物。
車端不也是一樣的道理嗎?殺雞焉用牛刀!如果只是在市區裡開個車切個菜,又不是讓你去造原子彈、當全能的具身智能家教,需要那麼驚天地泣鬼神的高智商嗎?
完全不需要!未來絕對是通過雲端協同,或者把大模型精準裁剪,搞出一個十幾二十萬的平民版。你以為你買的是個滿級號,其實平常跑的都是新手村配置,只有在面對極其變態的複雜路況時,它才會調用一點真本事!所以,別擔心買不起,主流入門版絕對能讓你消費得起。
L4 極大概率會比 L3 來得更快!
好了,最顛覆認知的邏輯來了。現在全行業都在等 L3 自動駕駛的普及,但我今天就把話放在這:L4 極大概率會比 L3 來得更快,而且快得多!
為什麼會得出這麼反常識的結論?
因為L3 意味著商業模式和責任主體的一次徹徹底底的變更。你的保險怎麼算?責任誰來定?整個鏈條要重寫!而且 L3 是要賣給普通消費者的。你要知道,消費者是這個世界上最難伺候的神仙!你把一個號稱完美的 L3 賣給他,他可是把你當全能神來要求的,他要求你的系統在任何極端天氣、任何變態路況下都完美無缺。只要稍微出點差錯,哪怕只是一次沒剎住,他都能把你祖宗十八代罵翻在熱搜上。
為了伺候好消費者,車企要投入海量的人力物力去填補那些永無止境的長尾場景,這筆賬在商業上根本算不過來!
但是 L4 呢?L4 是運營方驅動的!它是以純粹的商業用途為導向。只要能賺錢,我就在特定的運行設計域裡跑就行了。遇到搞不定的死角咋辦?很簡單,這個區域我不開放運營不就完了嗎!實在不行,我提前告知消費者,然後通過雲端輔助手段接管。
只要商業邏輯閉環了,投資回報率(ROI)算得過來,L4 就能直接落地賺錢。
這不就是純粹的降維打擊嗎?
當 L3 還在為了討好消費者而在無盡的代碼裡苦苦掙扎的時候,L4 早就靠著特定場景的商業運營開始瘋狂收割市場了!
不過說真的,老修作為一個被特斯拉坑了整整四年的老韭菜,現在唯一的願望就是:以後上車,前面方向盤直接給我拆了,騰個地兒讓他放杯茶泡個枸杞寫代碼。至於這車是 L3 還是 L4,只要別再讓他等“三個兩年”,哪怕你是人工智障他都認了!
越是完美的大餅,越是資本的鐮刀!



