同一件工作,讓一個模型自己做完、還是讓它發包給幾個小助手做, 成本會差 5 倍;而「叫它想深一點」這個旋鈕,其實省不到錢。
現在要一段程式寫出來,可以有好幾種做法:在終端機裡叫模型自己做、在桌面 App 裡做、 或是讓一個「主模型」把工作拆成幾張施工單再發包給幾個小助手去做。 每一種都做得出來,但花的錢差很多。問題是以前沒人量過差多少, 大家憑感覺選——而且一旦品質沒被固定住,比成本就沒有意義(便宜的那個可能只是做得比較爛)。
先寫好一份規格明確的程式任務,並且在任何一次執行開始之前就把驗收測試封存起來, 之後誰也不能改。然後固定其他條件、一次只換一個變因,跑 22 次:
每一次都記下吃掉多少 token、花多少錢、跑多久,最後用那份封存的測試打分。
一、發包很貴,而且小任務發包沒有好處。 輕中量的任務,發包給小助手要付 5.27 倍的 token、2.37 倍的錢、2.29 倍的時間, 而且主模型自己的負擔還變重。要等任務放大到 1.5 倍,發包的代價才降到 2.63 倍, 主模型的負擔才第一次真的減輕。
二、桌面 App 比終端機貴。同一件事在桌面 App 做,token 多 1.34 倍、錢多 1.72 倍。 不是 App 本身多收錢,是它每次多帶的那點固定開銷,被「請求次數 × 每次重讀的脈絡」放大成複利。
三、調低推理強度省不到錢。從 high 降到 medium,思考的 token 少了三分之一、 時間快了 14%,但總成本只降 5%,統計上跟沒差一樣。因為想得少了,來回次數卻變多,兩邊互相抵銷。
三件事指向同一個機制:錢主要花在「把已經講過的話再送一次給模型」(也就是 cache_read), 不是花在「模型想得多深」。所以真正有效的省錢方式只有兩種——把脈絡變短,或把來回次數變少。
我們沒有重跑那 22 次執行。那是他在自己機器上跑的,花了 $254。 我們做的是拿他封存的逐筆原始紀錄,在我們自己的機器上把論文裡的數字重新算一次, 再跑他附的四支檢核工具。
結果四項全過:文件標示齊全、匿名化過程沒有動到任何數字、 由原始紀錄重生的登記簿與他發布的版本逐位元組相同、論文頭條數字全部重現。 連他報的 cache_read 成本佔比下界 35.7%,我們算出來也落在同一筆執行(C3-03)上。
所以我們印證的是:他的帳算得對、資料沒被改過、結論跟原始紀錄對得上。 我們沒有印證「這些結論換一台機器、換一種工具也成立」——那要真的重跑才算數。
純新增 token=不含快取重讀的實際新產生量。發包那兩組(C3、XL-B)把小助手自己的 新增量也算進來,這正是差距的來源。橘色是發包組。
以 C1 為基準 1.000。⚠️ XL 那兩組跑的是另一份較大的規格,不與 C1 同分母, 同軸擺放只是方便對照;真正該看的是它們彼此的比值 2.625×。
按錢算,不是按 token 數算——兩者差很多,混用就會說錯話
(以 token 數算 cache_read 佔九成以上,但它每百萬 token 只要 $0.50,output 要 $25)。
18/22 筆可逐項計價;桌面 App 那四筆沒有這個欄位。cache_write 那段是殘差。
本機重算的 18 筆 cache_read 成本佔比全距 35.7%–57.3%。 論文報的上界 66.4% 來自桌面 App 那一筆,需要重算 transcript 才拿得到,本頁算不出來; 下界 35.7% 與筆別完全對上。
封存測試 22/22 滿分,但有一筆交付的介面是壞的。 XL-B-01 在測試上拿滿分,同時交出一個連資料夾都無法載入的畫面。 自動測試對介面完全沉默——它不是判它通過,它是根本沒有量。
更值得看的是離散度:同一組、同一份指令、同一個模型與強度, XL-B 三筆的交付品質橫跨整個範圍——一筆不可用、一筆版面仍有實質缺陷、一筆被評為全研究最好。
成本比值穩定,品質不穩定。只看上面那些圖做決策, 等於只改善剛好量得到的那個維度。這是本頁最重要的一句,儘管標題寫的是成本。
| 組 | 條件 | n | 純新增 token | 峰值脈絡 | 請求數 | 牆鐘 s | 成本 | 對 C1 |
|---|---|---|---|---|---|---|---|---|
| C1 | CLI × 獨力 × high(小契約) | 4 | 234,102 | 161,392 | 56.2 | 1,272 | $6.98 | 1.000× |
| C2 | Desktop × 獨力 × high(小契約) | 4 | 312,668 | 221,831 | 87.0 | 1,670 | $12.02 | 1.336× |
| C3 | CLI × 委派 × high(小契約) | 4 | 1,233,318 | 184,566 | 184.5 | 2,915 | $16.52 | 5.268× |
| M1 | CLI × 獨力 × medium(effort 消融) | 4 | 216,772 | 155,164 | 60.5 | 1,091 | $6.60 | 0.926× |
| XL-A | CLI × 獨力 × high(XL 契約) | 3 | 350,194 | 222,448 | 89.0 | 1,880 | $12.34 | 1.496× |
| XL-B | CLI × 委派 × high(XL 契約) | 3 | 919,283 | 204,106 | 206.0 | 2,515 | $15.96 | 3.927× |
| run | 組 | 純新增 | 小助手側 | 峰值脈絡 | 請求 | 小助手請求 | 牆鐘 s | 成本 | cache_read 成本佔比 | 驗收 |
|---|---|---|---|---|---|---|---|---|---|---|
| C1-04 | C1 | 263,442 | 0 | 174,974 | 65 | 0 | 1,402 | $8.17 | 46.7% | 1.00 |
| PILOT-C1-01 | C1 | 227,861 | 0 | 160,059 | 48 | 0 | 1,256 | $6.37 | 42.0% | 1.00 |
| PILOT-C1-02 | C1 | 211,349 | 0 | 149,185 | 61 | 0 | 1,214 | $6.69 | 48.5% | 1.00 |
| PILOT-C1-03 | C1 | 233,755 | 0 | 161,352 | 51 | 0 | 1,216 | $6.69 | 42.9% | 1.00 |
| C2-01 | C2 | 378,185 | 0 | 260,570 | 135 | 0 | 2,215 | $18.20 | — | 1.00 |
| C2-02 | C2 | 278,959 | 0 | 204,484 | 64 | 0 | 1,371 | $9.06 | — | 1.00 |
| C2-03 | C2 | 289,330 | 0 | 202,379 | 60 | 0 | 1,557 | $9.12 | — | 1.00 |
| C2-04 | C2 | 304,199 | 0 | 219,892 | 89 | 0 | 1,537 | $11.68 | — | 1.00 |
| C3-01 | C3 | 1,203,354 | 747,595 | 192,794 | 163 | 105 | 2,927 | $18.34 | 36.5% | 1.00 |
| C3-02 | C3 | 1,141,359 | 904,758 | 177,216 | 202 | 165 | 3,016 | $15.52 | 40.6% | 1.00 |
| C3-03 | C3 | 1,654,454 | 1,474,850 | 180,889 | 203 | 167 | 3,383 | $18.26 | 35.7% | 1.00 |
| C3-04 | C3 | 934,104 | 682,433 | 187,365 | 170 | 119 | 2,334 | $13.98 | 39.4% | 1.00 |
| M1-01 | M1 | 230,842 | 0 | 155,514 | 61 | 0 | 957 | $6.53 | 47.4% | 1.00 |
| M1-02 | M1 | 209,264 | 0 | 150,013 | 70 | 0 | 1,175 | $7.01 | 51.9% | 1.00 |
| M1-03 | M1 | 229,117 | 0 | 172,104 | 68 | 0 | 1,196 | $7.48 | 52.6% | 1.00 |
| M1-04 | M1 | 197,865 | 0 | 143,027 | 43 | 0 | 1,035 | $5.37 | 40.4% | 1.00 |
| XL-A-02 | XL-A | 290,581 | 0 | 194,936 | 87 | 0 | 1,568 | $10.60 | 55.3% | 1.00 |
| XL-A-03 | XL-A | 352,416 | 0 | 228,153 | 100 | 0 | 1,954 | $13.54 | 57.3% | 1.00 |
| XL-CAL-01 | XL-A | 407,586 | 0 | 244,255 | 80 | 0 | 2,119 | $12.88 | 49.4% | 1.00 |
| XL-B-01 | XL-B | 901,160 | 617,756 | 200,454 | 216 | 151 | 2,413 | $15.83 | 46.2% | 1.00 |
| XL-B-02 | XL-B | 1,016,754 | 750,831 | 194,306 | 173 | 127 | 2,772 | $15.67 | 40.5% | 1.00 |
| XL-B-03 | XL-B | 839,934 | 527,830 | 217,557 | 229 | 168 | 2,359 | $16.39 | 48.2% | 1.00 |
本機重算的四項:check_docs、deidentify --check、
build_manifest(重生的登記簿與發布版逐位元組相同,只差 CRLF 換行)、
paper_data(頭條數字全中)。
分組要照 prompt SHA,不是照 run_id 前綴。XL-CAL-01 屬於 XL-A 組,
用前綴分組會讓 XL-A 掉成 n=2、平均由 350,194 變成 321,498。這是重算時實際踩到的。
三臂、同一份規格、每臂 4 次:A 主模型自己做完、B 發包給同一家的子代理、 C 發包給 MiniMax(他量不到的那一臂)。錢按兩本帳分開記。 並且照上一節的教訓,這次一定要加一層人工檢查當第二個維度,而且要記離散度,不能只記平均。
原始研究:巴哲 bench-claude-arms,程式 MIT、數據與文件 CC BY 4.0。
本頁為衍生的可視化與導讀,數值未經修改。任何數字有疑義時,權威順序是
results/*/record.json > RUN_MANIFEST.md > 論文 > 本頁。