讓 AI 自己寫論文:Karpathy 的 autoresearch 如何用一個週末訓練出一個更好的模型
Andrej Karpathy 發了一個只有三個 Python 檔案的專案,卻引爆了整個 AI 社群。autoresearch 讓 AI agent 自主改代碼、訓練、評估、迭代——你睡一覺醒來,模型已經變強了。
AI Agent, 自動研究, 模型訓練, Karpathy, 開源專案, LLM
Slug
karpathy-autoresearch-autonomous-ai-research
GitHub URL
https://github.com/karpathy/autoresearch
Stable Diffusion Prompt
A futuristic laboratory scene with autonomous AI agents in a glowing server room, multiple screens showing training loss curves and neural network architectures, a scientist sleeping peacefully in a chair while AI agents work around them, holographic displays with code and training metrics, cyberpunk color palette with blues and purples, cinematic lighting, digital art style
封面處理
使用 Stable Diffusion 生成封面,上傳至圖床後更新 Notion Cover 欄位。
讓 AI 自己寫論文:Karpathy 的 autoresearch 如何用一個週末訓練出一個更好的模型
什麼是 autoresearch?
2026 年 3 月,Andrej Karpathy 在 X 上發了一條推文:
> 有一天,頂尖 AI 研究將由肉做的電腦在進食、睡眠、娛樂之間完成,偶爾通過「組會」這種聲波互連儀式進行同步。那個時代已經過去了。研究現在完全屬於在天空中計算機集群巨型結構上運行的自主 AI agent 叢群。
然後他丟了三個檔案:prepare.py、train.py、program.md。
這三個檔案就是整個 autoresearch——一個讓 AI agent 自主進行機器學習研究的開源專案。
核心理念
傳統的研究流程是這樣的:
- 你想到一個主意
- 你改代碼
- 你訓練模型
- 你看結果
- 你判斷好壞
- 重複
autoresearch 把這整條流程自動化了。你把 program.md(相當於給 agent 的指令文件)設定好,然後 agent 會自己:
- 修改
train.py(改模型架構、超參數、優化器、batch size) - 訓練 5 分鐘(固定的時間預算)
- 評估 val_bpb(驗證集 bits per byte,越低越好)
- 判斷 結果有沒有進步
- 保留或丟棄 修改
- 重複——一天可以做超過 100 次實驗
你早上醒來,看到的不是一個模型,而是一份完整的實驗日誌。
為什麼只有三個檔案?
autoresearch 的精妙之處在於極簡設計。它刻意保持最小範圍:
prepare.py — 一勞永逸的準備工作
這個檔案負責:
- 下載訓練資料集
- 訓練 BPE tokenizer
- 提供數據載入器和評估工具
規則:永遠不要改這個檔案。 它是一勞永逸的基礎設施。
train.py — agent 的唯一戰場
這個單一檔案包含了:
- 完整的 GPT 模型定義
- Muon + AdamW 優化器
- 完整的訓練循環
agent 會修改這個檔案的每一行——模型深度、注意力模式、學習率、batch size,全部都是 agent 的實驗空間。
program.md — 研究總監的指令
這是最關鍵的文件。你不是在寫 Python,你是在撰寫研究組織的文化。program.md 定義了:
- agent 的角色和目標
- 實驗評估標準
- 如何思考和決策
- 如何記錄實驗結果
這是一種全新的程式設計範式——你不再直接寫代碼,而是寫讓 agent 寫代碼的指令。
技術細節
固定的五分鐘預算
autoresearch 做了一個聰明的設計決策:每次訓練嚴格限制在 5 分鐘。
這意味著:
- 不管你用 H100 還是 RTX 4090,實驗結果可以直接比較
- 每小時大約 12 次實驗,一晚約 100 次
- 所有實驗結果在同一個基準線上公平對比
val_bpb:公平的比較基準
bits per byte(bpb)是一個與詞表大小無關的指標。這意味著當 agent 改變模型架構(比如從 8 層改成 4 層)時,評估結果依然公平可比。
Muon 優化器
autoresearch 使用了 Muon 優化器——這是一個相對新穎的優化器,在同等訓練時間下通常比 AdamW 表現更好。這也反映了 autoresearch 的哲學:讓 agent 去探索什麼是最優的,而不是你提前指定。
如何在你的環境中運行
前置要求
- 單張 NVIDIA GPU(官方在 H100 上測試)
- Python 3.10+
- uv 包管理器
啟動步驟
# 1. 安裝 uv(如果還沒裝的話)
curl -LsSf https://astral.sh/uv/install.sh | sh
# 2. 同步依賴
uv sync
# 3. 準備資料(一次性的,約 2 分鐘)
uv run prepare.py
# 4. 手動跑一次訓練(約 5 分鐘,確認環境正常)
uv run train.py啟動自主研究模式
現在,啟動你的 Claude、Codex 或其他 coding agent:
Hi, have a look at program.md and let's kick off a new experiment!
Let's do the setup first.然後你只需要看著。Agent 會自己閱讀 program.md,開始修改 train.py,訓練模型,評估結果,然後開始下一個實驗。
在消費級硬體上運行
沒有 H100?沒問題。Karpathy 提供了一些建議:
- 資料集:用 TinyStories(GPT-4 生成的兒童故事), entropy 更低,小模型也能訓練
- 詞表大小:從 8192 降到 2048 甚至 1024
- 序列長度:根據你的硬體調整,可以低到 256
- 模型深度:從 8 層降到 4 層
- 批次大小:降到
2**14(約 16K tokens)
社群也已經推出了多個 fork,支持 MacOS(MLX)、Windows(RTX)、AMD GPU 等平台。
為什麼這個專案很重要?
autoresearch 不僅僅是一個工具。它代表了一種研究範式的轉變:
從「寫代碼」到「編排 agent」
過去,研究員花 80% 的時間在調參、跑實驗、看結果上。autoresearch 把這個流程從「手動」變成了「自動化」。研究員的角色從「執行者」變成了「編排者」——你設計研究組織,agent 負責執行。
人類的直覺 + agent 的體力
人類最擅長的是提出好問題和設計實驗方向。AI agent 最擅長的是大量重複勞動和微調。autoresearch 把兩者結合:人類的直覺(program.md 中的研究方針)+ agent 的體力(100+ 次實驗/晚)。
可複現的自主研究
傳統的自主研究(比如 Google 的 AlphaDev)是封閉的。autoresearch 是開源的、可複現的。任何人都可以基於它構建自己的自主研究系統。
實際案例:autoresearch 發現了什麼?
在 autoresearch 的早期運行中,agent 發現了以下改進:
- 注意力模式優化:agent 自動選擇了更高效的注意力模式(如 SSSL 交替帶注意力),而非人類預設的標準 Transformer 結構
- 優化器組合:Muon + AdamW 的組合被 agent 發現比單獨使用任一優化器效果更好
- 學習率調度:agent 自動調整了學習率調度策略,在訓練後期有更具策略性的衰減模式
這些都不是人類研究員手動嘗試的結果,而是 agent 在 100+ 次實驗中自動發現的。
與相關專案的比較
- 專案定位差異
- ------------------
核心理念
傳統的研究流程是這樣的:
- 你想到一個主意
- 你改代碼
- 你訓練模型
- 你看結果
- 你判斷好壞
- 重複
autoresearch 把這整條流程自動化了。你把
program.md(相當於給 agent 的指令文件)設定好,然後 agent 會自己:
- 修改 train.py(改模型架構、超參數、優化器、batch size)
- 訓練 5 分鐘(固定的時間預算)
- 評估 val_bpb(驗證集 bits per byte,越低越好)
- 判斷 結果有沒有進步
- 保留或丟棄 修改
- 重複——一天可以做超過 100 次實驗
你早上醒來,看到的不是一個模型,而是一份完整的實驗日誌。
為什麼只有三個檔案?
autoresearch 的精妙之處在於極簡設計。它刻意保持最小範圍:
prepare.py — 一勞永逸的準備工作
這個檔案負責:
- 下載訓練資料集
- 訓練 BPE tokenizer
- 提供數據載入器和評估工具
規則:永遠不要改這個檔案。它是一勞永逸的基礎設施。
train.py — agent 的唯一戰場
這個單一檔案包含了:
- 完整的 GPT 模型定義
- Muon + AdamW 優化器
- 完整的訓練循環
agent 會修改這個檔案的每一行——模型深度、注意力模式、學習率、batch size,全部都是 agent 的實驗空間。
program.md — 研究總監的指令
這是最關鍵的文件。你不是在寫 Python,你是在撰寫研究組織的文化。
program.md 定義了:
- agent 的角色和目標
- 實驗評估標準
- 如何思考和決策
- 如何記錄實驗結果
這是一種全新的程式設計範式——你不再直接寫代碼,而是寫讓 agent 寫代碼的指令。
技術細節
固定的五分鐘預算
autoresearch 做了一個聰明的設計決策:每次訓練嚴格限制在 5 分鐘。
這意味著:
- 不管你用 H100 還是 RTX 4090,實驗結果可以直接比較
- 每小時大約 12 次實驗,一晚約 100 次
- 所有實驗結果在同一個基準線上公平對比
val_bpb:公平的比較基準
bits per byte(bpb)是一個與詞表大小無關的指標。這意味著當 agent 改變模型架構(比如從 8 層改成 4 層)時,評估結果依然公平可比。
Muon 優化器
核心理念
傳統的研究流程是這樣的:
- 你想到一個主意
- 你改代碼
- 你訓練模型
- 你看結果
- 你判斷好壞
- 重複
autoresearch 把這整條流程自動化了。你把
program.md(相當於給 agent 的指令文件)設定好,然後 agent 會自己:
- 修改 train.py(改模型架構、超參數、優化器、batch size)
- 訓練 5 分鐘(固定的時間預算)
- 評估 val_bpb(驗證集 bits per byte,越低越好)
- 判斷 結果有沒有進步
- 保留或丟棄 修改
- 重複——一天可以做超過 100 次實驗
你早上醒來,看到的不是一個模型,而是一份完整的實驗日誌。
為什麼只有三個檔案?
autoresearch 的精妙之處在於極簡設計。它刻意保持最小範圍:
prepare.py — 一勞永逸的準備工作
這個檔案負責:
- 下載訓練資料集
- 訓練 BPE tokenizer
- 提供數據載入器和評估工具
規則:永遠不要改這個檔案。它是一勞永逸的基礎設施。
train.py — agent 的唯一戰場
這個單一檔案包含了:
- 完整的 GPT 模型定義
- Muon + AdamW 優化器
- 完整的訓練循環
agent 會修改這個檔案的每一行——模型深度、注意力模式、學習率、batch size,全部都是 agent 的實驗空間。
program.md — 研究總監的指令
這是最關鍵的文件。你不是在寫 Python,你是在撰寫研究組織的文化。
program.md 定義了:
- agent 的角色和目標
- 實驗評估標準
- 如何思考和決策
- 如何記錄實驗結果
這是一種全新的程式設計範式——你不再直接寫代碼,而是寫讓 agent 寫代碼的指令。
技術細節
固定的五分鐘預算
autoresearch 做了一個聰明的設計決策:每次訓練嚴格限制在 5 分鐘。
這意味著:
- 不管你用 H100 還是 RTX 4090,實驗結果可以直接比較
- 每小時大約 12 次實驗,一晚約 100 次
- 所有實驗結果在同一個基準線上公平對比
val_bpb:公平的比較基準
bits per byte(bpb)是一個與詞表大小無關的指標。這意味著當 agent 改變模型架構(比如從 8 層改成 4 層)時,評估結果依然公平可比。
Muon 優化器
autoresearch 使用了 Muon 優化器——這是一個相對新穎的優化器,在同等訓練時間下通常比 AdamW 表現更好。這也反映了 autoresearch 的哲學:讓 agent 去探索什麼是最優的,而不是你提前指定。
如何在你的環境中運行
前置要求
- 單張 NVIDIA GPU(官方在 H100 上測試)
- Python 3.10+
- uv 包管理器
啟動步驟
# 1. 安裝 uv(如果還沒裝的話)
curl -LsSf https://astral.sh/uv/install.sh | sh
# 2. 同步依賴
uv sync
# 3. 準備資料(一次性的,約 2 分鐘)
uv run prepare.py
# 4. 手動跑一次訓練(約 5 分鐘,確認環境正常)
uv run train.py啟動自主研究模式
現在,啟動你的 Claude、Codex 或其他 coding agent:
Hi, have a look at program.md and let's kick off a new experiment!
Let's do the setup first.然後你只需要看著。Agent 會自己閱讀 program.md,開始修改 train.py,訓練模型,評估結果,然後開始下一個實驗。
在消費級硬體上運行
沒有 H100?沒問題。Karpathy 提供了一些建議:
- 資料集:用 TinyStories(GPT-4 生成的兒童故事),entropy 更低,小模型也能訓練
- 詞表大小:從 8192 降到 2048 甚至 1024
- 序列長度:根據你的硬體調整,可以低到 256
- 模型深度:從 8 層降到 4 層
- 批次大小:降到 2^14(約 16K tokens)
社群也已經推出了多個 fork,支持 MacOS(MLX)、Windows(RTX)、AMD GPU 等平台。
為什麼這個專案很重要?
autoresearch 不僅僅是一個工具。它代表了一種研究範式的轉變:
從「寫代碼」到「編排 agent」
過去,研究員花 80% 的時間在調參、跑實驗、看結果上。autoresearch 把這個流程從「手動」變成了「自動化」。研究員的角色從「執行者」變成了「編排者」——你設計研究組織,agent 負責執行。
人類的直覺 + agent 的體力
人類最擅長的是提出好問題和設計實驗方向。AI agent 最擅長的是大量重複勞動和微調。autoresearch 把兩者結合:人類的直覺(program.md 中的研究方針)+ agent 的體力(100+ 次實驗/晚)。
可複現的自主研究
傳統的自主研究(比如 Google 的 AlphaDev)是封閉的。autoresearch 是開源的、可複現的。任何人都可以基於它構建自己的自主研究系統。
實際案例:autoresearch 發現了什麼?
在 autoresearch 的早期運行中,agent 發現了以下改進:
- 注意力模式優化:agent 自動選擇了更高效的注意力模式(如 SSSL 交替帶注意力),而非人類預設的標準 Transformer 結構
- 優化器組合:Muon + AdamW 的組合被 agent 發現比單獨使用任一優化器效果更好
- 學習率調度:agent 自動調整了學習率調度策略,在訓練後期有更具策略性的衰減模式
這些都不是人類研究員手動嘗試的結果,而是 agent 在 100+ 次實驗中自動發現的。
與相關專案的比較
autoresearch:讓 agent 改代碼、訓練、評估 | NexusGenome:讓 agent 寫完整應用 | Autogen / CrewAI:多 agent 分工,非自主研究 | AI Engineer:通用 agent 工具,非研究專用
總結
autoresearch 是 2026 年最值得關注的開源專案之一。它的核心洞察很簡單卻極其強大:你不需要親手寫每一行代碼來做研究——你只需要設計研究組織,讓 AI 去執行。
三個檔案,一個週末,一個更好的模型。這就是未來的研究方式。
原文來源:karpathy/autoresearch
Tags: AI Agent, 自動研究, 模型訓練, Karpathy, 開源專案, LLM
Status: Draft