編輯|張倩
作為一個普通人,如果你把一道數學難題給到 AI,并一直讓它「繼續」,它有沒有可能真的把這道題解出來,從而幫你贏得一大筆獎金,甚至改寫數學發展進程?
(相關資料圖)
最近,菲爾茲獎公布,大家對于數學 + AI 的討論非常熱烈,相信也有不少人想象過我剛剛描述的「爽文」劇情。
其實,現實里也真的有人在嘗試,但過程并沒有想象中順利。
最近,可逆計算、計算物理學頂尖專家 Michael P. Frank 發文表示,他給 GPT-5.6 Sol 設定了一個高難度研究目標:探究費馬大定理是否存在比懷爾斯 - 泰勒證明更簡潔的途徑,重點放在專門的 Frey 曲線模性、一致無限下降法、算術 abc 型不等式以及一致低虧格商上;保持嚴謹的筆記,通過計算驗證候選引理,并清楚區分已證明的結果與推測。
這個任務在后臺持續運行了大約 33 個小時,消耗了大量計算資源。但最終,它被 OpenAI 系統強制阻止了。
GPT-5.6 Sol 在自己給出的事后分析中寫到,可能的原因有兩個:一是系統判定該會話占用了過多資源;二是 OpenAI 之前已經用類似模型嘗試過這個問題但失敗了,這次不想再浪費算力。
Michael P. Frank 似乎贊同 GPT-5.6 Sol 的這一分析。
此外,GPT-5.6 Sol 還坦誠報告了這 33 小時所做的事情,核心是:做了不少扎實工作,把很多「聽起來可行」的捷徑變成了可驗證的精確陳述,然后一一證偽或排除。產出是一張「此路不通」的地圖,而不是證明本身。建議就此打住。
對于 OpenAI 的這種做法,還有人給出了其他可能的解讀:OpenAI 可能在藏著掖著,不讓模型隨便解決超級牛的數學問題,怕被別人搶了風頭,或者想自己拿去吹牛。這就給大家提了個醒:如果以后太依賴他們,就等于把「什么能被發現」的權力全交給他們一家了,這很危險。
但很快,OpenAI 高級研究科學家 Noam Brown 就站出來指出了這一說法的不合理性,他說:「要是有人只是輸入一個 continue(繼續),就用我們的模型解決了千禧年大獎難題,然后拿走 100 萬美元獎金,這對 OpenAI 來說才是最好的廣告,沒有比這更好的了。」
聽起來很有道理,但反駁者認為,開放頂尖能力給用戶確實可能帶來短期宣傳收益,但長期看會削弱 OpenAI 在 AI 競賽中的領先優勢。在多玩家競賽環境下,保密 / 內部優先使用強模型來加速自家研究,比讓用戶「搶先」解決大問題更重要。而一旦能力變得「人人可用」,宣傳價值就會大幅下降。
此外,最近的監管風波也讓 OpenAI 有理由保存實力。如果用戶用公開版解決了高難度數學問題,就等于公開證明「這模型其實很強」,反而會引來監管麻煩。這種情況下,刻意對外提供弱化版模型,而內部保留超強版本聽起來是個合理的做法。
不過,也有人從技術層面指出了另一種可能性:在 codex-cli 里,「goal blocked」的意思是模型在連續 3 個推理輪次(turns)里反復撞上同一個限制 / 阻擋點(blocker)。所以任務被組織可能是模型運行時的常規安全 / 防止卡死機制,而不是針對難題的特殊阻擋。
還有人說,這可能就是一個 bug 導致的。具體來說,5.6 版本的 Sol 在長時間運行任務時有個煩人的 bug,臨時解決辦法是:切換回 5.5 版本,壓縮一下上下文,用 5.5 繼續跑幾分鐘,然后再切回 5.6 版本的 Sol?!溉绻阆氡A敉粋€會話(session),就會卡住出不來。」
你怎么看?歡迎在評論區分享用 AI 攻克難題或被它卡住的經歷。
參考鏈接:https://x.com/lu_sichu/status/2081367506468360495