在地球物理學裡,你幾乎從來看不到你正在研究的東西。你看到的是地震波形、重力異常、電阻率曲線。你看不到岩石本身。你看到的是岩石的回音,而你必須去猜地下哪種結構會剛好產生那個回音,而不是別的。沒有人會直接把答案交給你。你是從結果去推斷原因。
我很多年都沒再想過大學時學到的那一部分,直到我做出了 Bookmark Brain。
Bookmark Brain 是一個 RAG 流程,訓練資料來自我自 2016 年以來在 X 上的書籤與喜歡。上次我寫到這件事時,大約是 50,000 筆;現在已經有 70,000 筆了。排程工作會自動拉進新的收藏;完全不需要人工重新整理。你問它問題,它會檢索最接近的已保存內容,然後組成一段聽起來像我會說的答案。它運作得很好,老實說,太好了。當我問它對 API 設計的看法時,它聽起來比大多數通用模型在我要求它們用我的口吻寫作時還像我。
原因不在模型,而在檢索層。我的書籤之所以有一致性,是因為我花了十年把它們整理成某種特定的世界觀。這個機器人只是找出最近鄰,然後把它包裝成一個流暢的句子。它做不到的是:在我測試它時真正需要它做的那件事——化解我多年以前收藏的兩則內容之間的矛盾。它不會調和它們。它只會選出在語意上更接近問題的那一個,然後把那個回傳給我。
這不是我這條流程的 bug。這就是檢索做不到的整個類別。
Amni Rusli 在 2014 年寫的一篇部落格文章〈Irreplaceable Us〉,大致上提出了同樣的觀點,只是沒有 RAG 流程。她寫道,機器只能在給定的參數之內運作——餵給它資料和程式碼,它就會永遠在那個空間裡最佳化下去。它做不到的是,直接跳到一個完全不同的參數池裡,然後把某種東西帶回來。她用愛因斯坦和狄拉克當例子。愛因斯坦讀休謨和馬赫,直到他有勇氣拋棄絕對同時性。狄拉克告訴波耳,克萊因早就解決了相對論電子問題,然後仍然去找別的答案,因為既有的答案不符合他那個「可愛的」理論。
十二年後,在一月,Google DeepMind 發表了一篇論文,以更去個人化的方式提出了同樣的主張。Tom Zahavy 的〈LLMs Can't Jump〉從愛因斯坦真的畫過的一張圖開始,那是他寫給 Maurice Solovine 的信裡的圖:感官經驗跳躍到一套公理系統,接著再從那裡往前做演繹。Peirce 替這個跳躍中的落差取了名字,而這篇論文借用了它。演繹:規則加案例得到結果,這是唯一能保證真理的模式。歸納:案例加結果得到規則,這很接近把一個 LLM 放在一兆份文件上訓練時實際在做的事。溯因:規則加上一個令人驚訝的結果,得到一個新的案例,或一條新的規則,來解釋它。那就是地球物理學的那個動作。那就是化解我自己書籤裡的矛盾。那也是至今沒有人自動化的那一步。
這篇論文認為,為什麼規模擴大也無法解決這件事,原因是資料稀缺。廣義相對論並不是從大量既有實驗結果中歸納出來的,因為根本沒有那麼多。那些公理也不可能是透過演繹得來的,因為演繹只能沿著某個人已經擁有的前提往前推。一定有別的東西產生了那些前提。那個東西就是跳躍,而它至今仍然缺席。
接著,Kimi K3 發表了。2.8 兆參數,史上釋出的最大開源權重模型,在程式設計與代理任務上的評測成績緊追 Fable 5 和 GPT-5.6 Sol。Moonshot 自己的說法是,單位算力的智慧密度是上一代的 2.5 倍。這些都不會改變前面的論點。更大的訓練集會讓歸納更好,也會讓更長鏈條上的演繹更可靠。它不會憑空多出一種原本不存在的第三種能力。把更多網路資料餵給模型,你得到的是更像樣的組合器,而不是不同類型的東西。
在我讀 DeepMind 那篇論文之前,我曾在自己原本那篇關於機器人的貼文下回應一位留言者:一個在牛頓物理上訓練到足夠大規模的模型,會產生更好的牛頓式預測,而不是狹義相對論。事實證明,這就是整個論旨,只是從不同方向抵達——一個是我看著自己的檢索紀錄得到的,一個是透過對 Peirce 的正式閱讀得到的。
這又把我帶回我自己的書籤。
每一次我決定某則推文值得收藏時,真正發生的事,其實都是那個跳躍的小型版本。這跟那個有關。這跟我去年相信的東西矛盾。先存起來。我從 2016 年就一直在這樣做——十年來,一次一個小跳躍。Bookmark Brain 繼承了這些跳躍留下的殘餘,但它自己從來沒有做出過跳躍。
這才是更值得人們擔心的地方,而不是那些基準測試圖表。不是模型能不能在思考上超過愛因斯坦,而是大多數被付錢去做的事情,本來也不是那個跳躍。
我負責寫文章,但我總是先把論點收藏起來。現在我把時間花在這裡——不是花在寫作上,因為模型只會在那部分變得越來越好,而是花在判斷什麼值得保存。跳躍無法擴展。至少我的跳躍,至今仍然必須一次一個書籤地發生。
原文出處:https://dev.to/dannwaneri/why-kimi-k3-still-cant-do-what-einstein-did-2l6d