最近我在做一件以前不會做的事:算 AI 的 CP 值。
過去這一兩年,大家在比什麼?比誰的模型最聰明。誰的分數高、誰的榜單贏、誰又刷新了什麼紀錄。但我最近越用越清楚,這個比法已經過時了。現在真正在比的,是誰完成一個任務的 CP 值最高。而這個 CP 值包含三件事:時間、算力、金錢。
- 同時有好幾個模型可以用,每次都習慣直接開最強那個的人
- 開始感覺到 API 帳單或訂閱費在往上走的人
- 想知道什麼任務該用哪一級模型的人
- 三個模型的實際成本對照,看懂便宜為什麼可能更貴
- 一個選模型的判斷句:先問這次需要幾分
- 一個更前面的問題:哪些問題值得被解決
三個模型的比喻
假設你手上有三個模型。
第一個是旗艦模型,實力 100 分。你問它一個問題,一次就給你滿分的答案。缺點是它很貴,問一次要 100 塊,而且要跑 10 分鐘。
第二個是中階模型,一次只有 80 分。但它便宜,一次才 10 塊。你可以讓它自己反覆迭代:問第二次變 90 分,第三次 95 分,問到第五次就補到 100 分了。五次加起來 50 塊,同樣是滿分,只花了旗艦一半的錢。代價是一次要跑 10 分鐘,五次就是 50 分鐘,比較耗時間。
第三個是最便宜的模型,一次 5 塊,很快,但一次只有 60 分。聽起來 CP 值最高對吧?問題是它上限很低,而且反覆迭代容易失真,越問越走鐘。你要把它逼到 100 分,可能得問 30 次,算下來 150 塊,還要跑兩個半小時。
一張表看懂
三個模型的基本盤
| 模型 | 單次品質 | 單次價格 | 單次耗時 |
|---|---|---|---|
| 旗艦 | 100 分 | 100 元 | 10 分 |
| 中階 | 80 分 | 10 元 | 10 分 |
| 平價 | 60 分 | 5 元 | 約 5 分 |
各自逼到 100 分的代價
| 模型 | 迭代到滿分要幾次 | 總花費 | 總耗時 |
|---|---|---|---|
| 旗艦 | 1 次 | 100 元 | 10 分鐘 |
| 中階 | 5 次(80→90→95→100) | 50 元 | 50 分鐘 |
| 平價 | 30 次(60→80→90→100) | 150 元 | 2.5 小時 |
看你要幾分,選不同的模型
| 你的需求 | 最佳選擇 |
|---|---|
| 100 分,要最快 | 旗艦(10 分鐘一次到位) |
| 100 分,要最省 | 中階(50 元,比旗艦省一半) |
| 只要 80 分 | 中階(一次 10 元就夠) |
| 只要 60 分 | 平價(一次 5 元、5 分鐘) |
所以真正該問的從來就是「你這次的任務,到底需要幾分」,「哪個模型最強」反而排在後面。
要最快拿到 100 分,用旗艦,10 分鐘搞定。要最省錢拿到 100 分,用中階,讓它慢慢磨。如果這件事其實只需要 60 分,那最便宜的模型問一次就夠了,何必動用旗艦。
我們都快變成算力精算師
這就是為什麼我說,模型不是越聰明越好。我們這些天天在用 AI 的人,正在變成一種新的角色:算力精算師。
為什麼精算變得這麼重要?因為兩件事同時在發生。一邊是我們要處理的任務越來越複雜,一邊是算力越來越貴,不管你用的是雲端的 API,還是本地模型要搭配的硬體,成本都在往上走。
當每一次呼叫都是錢、都是時間,你就不可能再無腦地「反正用最強的就對了」。你得像一個會算帳的人一樣,替每個任務挑對工具。
但更前面的問題是:哪些問題值得被解決
我想講的其實不只是選模型這件事。
當新一代的模型真的越來越能解決問題,AI 已經被拿去做癌症的早期預防這種等級的事,我覺得人類該思考的問題,已經悄悄換了一層。
以前我們問:AI 能不能解決這個問題?現在這個問題快要不成立了,因為答案越來越常是「能」。於是真正的問題浮上來了:
算力是有限的。要解的問題卻多到滿出來。當你手上的資源不再是無限的聰明,而是一格一格要精算的成本,你就被迫排序。
這其實跟前面那張 CP 值表是同一件事,只是放大到了人類的層級:先想清楚「這件事,值不值得做到滿分」,再決定要不要把力氣花在「能不能做到滿分」。
會算 CP 值,是這個時代的基本功。會排序哪些問題值得解,才是真正的分水嶺。
把 AI 用成幫你累積判斷力的工具
我每月固定舉辦兩場免費線上講座,主題輪流談怎麼把工作流程、判斷、經驗,整理成 AI 能靈活運用的提示詞、技能包與知識庫。想收到開課通知,或想討論自己的任務該用哪一級模型,都歡迎先從社群開始。
免費講座場次會先在這裡公布,也可以把你的實際用量拿出來一起算。
加入社群 ↗