AI 界大神 Andrej Karpathy 的開源專案 「Autoresearch」 近期引發了一場震撼實驗。研究員 Alex Kim 與 Romil Bhardwaj 移除單機運算的瓶頸,賦予 AI 代理(Claude Code)調度 16 張高階 GPU(H100 與 H200) 的權限。實驗結果顯示,AI 不僅在 8 小時內瘋狂完成 910 次實驗,更在無人類干預下,自主發展出資深研究員等級的「算力分配策略」,展現了令人驚訝的具身智能演進。

  1. 實驗設定:5 分鐘的極限生存挑戰
    「Autoresearch」的核心是一個封閉的優化循環。
    唯二限制: AI 只能修改 train.py 訓練腳本,且每次實驗的硬體訓練時間嚴格限制在 5 分鐘內。

    目標: 在極短時間內透過修改模型架構、優化器(Optimizer)或超參數,盡可能降低 GPT-2 模型的驗證損失。
    算力升級: 導入 SkyPilot 調度工具,讓 AI 從單機作業進化為擁有 16 個雲端叢集分身的「平行研究員」,吞吐量瞬間暴增 9 倍。

  2. 五階段演進:從暴力測試到架構發現
    AI 在 8 小時的實驗過程中,自發性地展現了邏輯清晰的演進階段。
    基礎掃射期: 前 200 個實驗中,AI 同時測試了所有常見的超參數(如 Batch Size、學習率),快速鎖定基礎最佳解。

    架構擴張期: 憑藉平行運算優勢,AI 在同一波次測試多種模型寬高比,這種「多線並進」的深度探索是單機作業無法想像的。
    精準微調期: 針對優化器數值,AI 甚至動用 10 個叢集來驗證微小數值的變動,最終鎖定能讓梯度平滑的關鍵參數。

  3. 驚人的湧現能力:自主發明「雙層驗證」策略
    這是實驗中最讓研究圈沸騰的發現:AI 學會了區別硬體價值並分配預算。
    硬體感知: 研究員並未告知 AI 存在 H100 與 H200 的效能差異,但 AI 透過分析運算日誌,發現其中 3 個叢集(H200)的表現始終優於其他 13 個。

    預算管理: 發現資源稀缺性後,AI 自主建立了一套工作流:利用較慢的 H100 進行「海選」狂野想法,再將表現優異的「決賽入圍者」送往珍貴的 H200 進行「最終驗證」。
    研究員直覺: 這種「分層過濾」是資深人類研究員才會使用的實驗策略,而 AI 僅憑數據反饋便自行推導並執行。

結語:從「代碼生成」到「科研決策」
這場實驗證明,AI 代理在獲得算力自主權後,展現的不只是暴力破解的產能,更是優化實驗路徑的決策能力。當 AI 開始懂得如何管理預算與資源,未來的科研與軟體開發模式,將從「人類指導 AI」轉向「AI 自主尋找最優路徑」,人類則退居為資源的提供者與願景的設定者。

stanCode daily AI科技新聞
2026.3.25 | 當 AI自己訓練模型、材料 AI 的模型 GNoME 與新創 Periodic Labs、2026 圖靈獎得主

🔗收聽連結🔗
一起來了解更多AI相關新聞吧!

Close Menu