DEV Community

Cover image for Which Flash To Run — 五個便宜模型的成本與能力實測
Yang Goufang
Yang Goufang

Posted on Edited on

Which Flash To Run — 五個便宜模型的成本與能力實測

2026-08-29 修訂。 原文發表的隔天,成本那一半就過期了:GLM 從按量變成訂閱制(同一個 GLM-5.3-Flash 從 $0.05/M 變成邊際 $0,而且是第一方)、deepcode 以價格理由退役、另外兩個完全免費的 GLM 門開了出來。能力與量測那一半沒有動。完整改動列在文末〈修訂記錄〉。

一句話摘要: 便宜模型沒有總冠軍,但 2026-08-29 起有了明確順位——日常主力 zcode(GLM-5.3-Flash,訂閱制邊際 $0),Codex 側 baicodex(qwen3.8-flash,週配額邊際 $0);真的要按 token 付費才輪到 opzcode。其餘差別不在牌價,而在到期日、隱形 thinking、被 hook 借走的 base_url,與權限的前提。

2026-08-27 實測,主角是五個便宜選項:三家 Flash(Qwen3.8-Flash、GLM-5.3-Flash、DeepSeek V4 Flash Vision-Exp)、Muse Spark 1.2 contributor、Dots3-Note preview:free。先講結論,再攤帳單與數字。

結論:按「你現在要做什麼」選

┌──────────────────────────────────────────────────────────────────────────┐
│  沒有總冠軍,但有順位:兩個邊際 $0 的門排前面                              │
├──────────────┬──────────────┬──────────────┬─────────────────────────────┤
│ 日常主力     │ Codex 側     │ 按量最佳     │ 完全免費                    │
│ zcode        │ baicodex     │ opzcode      │ z47code / z46vcode          │
│ $0 訂閱制    │ $0 週配額    │ $0.05 /M     │ $0 · glm-4.7 / 4.6v         │
│ GLM-5.3 Flash│ qwen3.8-flash│ 促銷至 09-09 │ 200K ctx · 後者吃圖         │
└──────────────┴──────────────┴──────────────┴─────────────────────────────┘
     跨檔大改 → opzcode / zcode(同模型,避開 qwen 的 NL2Repo 48.1)
     要 WebSearch → 目前沒有活路徑(見下)
Enter fullscreen mode Exit fullscreen mode
情境 用這個 為什麼
日常主力(Claude Code) zcode(glm-5.3-flash · BigModel 第一方) GLM Coding Plan Pro 訂閱制,邊際 $0;agentic 四軸全第一、AA 指數並列最高。這是 opzcode 跑的同一個模型,但走第一方且不按量計費
Codex 側主力 baicodex(qwen3.8-flash · token plan · Codex) 週配額已付過,邊際 $0;agentic 表現與 DeepSeek 同級(四軸各贏兩軸)
真的按量付費 opzcode(z-ai/glm-5.3-flash:floor · OpenRouter) 沒有訂閱時的最佳按量價,blended $0.05;但促銷 2026-09-09 到期
跨檔案大改 opzcodezcode(都是 GLM-5.3-Flash) Qwen 在 NL2Repo 掉到 48.1,輸 GLM 8.2 分且有使用者回報佐證
零成本 / 要吃圖 z47code(glm-4.7-flash)、z46vcode(glm-4.6v-flash) 官方標示完全免費、200K context;後者收影像與影片輸入(V = vision)
要 WebSearch 目前沒有活路徑 DeepSeek 官方端點是唯一真的回 server_tool_use 的,但 deepcode 已退役;ModelStudio 的 /apps/anthropic 從來不觸發它

命名規則(2026-08-27 起):裸名就是該家族的 flash,旗艦才加標記,標記用廠商自己的字——Qwen 說 max、DeepSeek 說 pro。所以 baicodex 是 flash、baimaxcodex 是旗艦,opgflashcode 改叫 opzcodeflash 不再出現在名字裡。

這條規則在 08-29 補了一個反例: GLM 沒有自己的 tier 字。glm-5.3glm-5.3-flash,頂規那個沒有名字,所以原本借用通用字的 zmaxcode 改叫 zglmcode——廠商哪天真的出一個 GLM max,借來的字就會撞名。沒有廠商自己的 tier 字時,用 family name,不要借一個通用的。

三個到期日:

  • opzcode 的 $0.05 到 2026-09-09:Z.ai 在 OpenRouter 的促銷結束,那三家回到兩倍價。而且預設路由不會偏好便宜的那幾家——實測 18 次,裸 id 只有 10 次落在促銷價,加權後 $0.102/M input,比牌價貴 36%;現已釘 :floor 壓回促銷價(20/20 命中)。
  • dotscode 的免費預覽到 2026-09-30,屆時以「未知 id」400。
  • baicodex 的 token plan 到 2026-10-23,且 auto-renew 是關的(原文漏了這條)。到期時 baicodex/baimaxcodex/baideepcodex 一起停。重買會發新的 API key,不是續用舊的。

成本:牌價不是重點,帳單機制才是

blended 按 7:2:1(cache hit : input : output)估。

成本一覽(每 M tokens)— 純文字,無圖床依賴

zcode     █ $0.00  ████████████████████ 訂閱制邊際零成本  ← 新增
z47code   █ $0.00  ████████████████████ 官方標示免費      ← 新增
z46vcode  █ $0.00  ████████████████████ 官方標示免費・吃圖 ← 新增
baicodex  █ $0.00  ████████████████████ 邊際零成本(週配額已付)
dotscode  █ $0.00  ████████████████████ 免費預覽
musecode  █ $0.041 ████▎
opzcode   █ $0.05  █████▎  (不釘 :floor 實測 $0.068)
deepcode  █ ——     已退役(原 $0.23 尖峰)
          └──────────────────────────────
           $0        $0.10        $0.20
Enter fullscreen mode Exit fullscreen mode
Wrapper 牌價 in / out(每 M) Blended 我們實付
zcode — glm-5.3-flash · BigModel 第一方 $0.075 / $0.25 促銷價 2026-09-09 止,之後約 $0.15 / $0.45–0.50 $0(Coding Plan Pro 訂閱)
z47code — glm-4.7-flash · 200K ctx 官方標示免費 $0 $0
z46vcode — glm-4.6v-flash · 收影像輸入 官方標示免費 $0 $0
baicodex — qwen3.8-flash · token plan · Codex $0.15 / $0.47 $0.088 $0(plan 到 2026-10-23)
dotscode — dots-3-note-preview:free $0 / $0 $0 $0(到 2026-09-30)
musecode — muse-spark-1.2-contributor $0.10 / $0.20 $0.041 $0.041
opzcode — z-ai/glm-5.3-flash:floor · OpenRouter $0.075 / $0.25 促銷價 2026-09-09 止 $0.05 $0.05(不釘 :floor 實測 $0.068)
deepcode — deepseek-v4-flash-vision-exp 離峰 $0.22 / $0.66 尖峰 $0.44 / $1.32 $0.115 / $0.23 已於 2026-08-29 退役

訂閱制的帳單形狀和按量完全不同,這才是 zcode 排第一的理由。 GLM Coding Plan Pro 是雙視窗配額:每 5 小時 12,000 點 + 每週 60,000 點。點數 = (input×2.3 + cached×0.56 + output×8)/10000(flash 檔)。兩個關鍵性質:

  • 離峰只算一半點數,而尖峰只有週一至週五 14:00–18:00(UTC+8)那四個小時。 早上、晚上、整個週末都是離峰——這跟 DeepSeek 尖峰蓋掉整個工作日是相反的形狀。
  • 配額用完是硬停,不是帳單。 它不會回頭吃資源包或帳戶餘額,所以一個耗盡的視窗不可能超支。這一點跟本文其他每一個按量端點都不同:那些用超了只會安靜地繼續計費。

DeepSeek 的時段差價(歷史記錄,模型已退役): 尖峰只在週一至週五 09:00–12:00 與 14:00–18:00(台北時間 = UTC 01–04 / 06–10),週六日全天按離峰計價(2026-08-23 起)。留著這張圖是因為它正是 deepcode 被淘汰的原因——尖峰蓋住整個上班時段,而兩個對手都變成了固定費率。

台北時間(週一至週五)— 尖峰 2倍價,週末全離峰
 00         09         12   14         18         24
  ├──────────┼──────────┼────┼──────────┼──────────┤
  │  離峰    │   尖峰   │ 離峰│   尖峰   │   離峰   │
  │ ████████ │ ████████ │ ██ │ ████████ │ ████████ │
  │ 9h       │ 3h       │ 2h │ 4h       │ 6h       │
  └──────────┴──────────┴────┴──────────┴──────────┘
         週六日 ─── 全天離峰(半價)
Enter fullscreen mode Exit fullscreen mode

關掉的門

這些不是表上的選項了,列在這裡是因為名字還會出現在舊筆記和肌肉記憶裡。

  • deepcode(2026-08-29 新增)— 以價格退役。自 2026-08-16 重新定價後 DeepSeek flash 按時段計費,而尖峰蓋住整個工作日;對手同時都轉成固定費率(GLM 訂閱、qwen 週配額邊際 $0)。它唯一的差異化能力——唯一真的實作伺服器端 web_search 的 DeepSeek 表面(回 server_tool_use + web_search_tool_result)——不足以養活一個沒有價格利基的按量 wrapper。復活的方式是拿掉表上的退役標記。
  • ocode — 已停用。Go plan 對每個模型都回 CreditsError,但 qwen3.8-flash 回的是 ModelError: not supported——後者不是帳務症狀,就算續訂也接不到 flash。
  • baicode / baiflashcode — ModelStudio 的 Claude Code wrapper 全數移除。token plan 的 Anthropic 路徑(/apps/anthropic)是沒有內建 server tools 的端點,留著等於讓缺口被誤觸,整家改走 Codex 的 compatible-mode
  • baiflashcodex — 併入 baicodex,刪掉不是留 alias——留 alias 會讓舊肌肉記憶繼續指向貴的那一個。
  • baimaxcodex — 仍在,但在觀察名單上。qwen3.8-max 慢、有幻覺,該淘汰;留著只是佔住旗艦位置等 Qwen 下一版。

退役機制本身也被改掉了(08-29)。 原文說 ocode 是「把 key 註解掉」——那是錯的形狀,而且當天就被推翻:~/.secrets每台機器各自的,所以同一個退役在一台讀 inactive、在另一台讀 active。改成在表上標 retired = true(軟刪除)+ 每列一份帶日期的 events退役是資料,不是註解掉的環境變數。

能力:廠商自評

表示該廠商沒公布,不是零分。* 標該列最高。

能力對照(廠商自評,非獨立複現)

Terminal Bench 2.1    GLM  84.3*  DeepSeek 82.7  Vision-Exp 83.9  Muse 82.9△  Dots 75.1  Qwen —
DeepSWE v1.1          GLM  63.4*  Qwen 58.7  DeepSeek 54.4
NL2Repo               Vision-Exp 57.7*  GLM 56.3  DeepSeek 54.2  Qwen 48.1
Toolathlon Verified   GLM  78.4*  Qwen 73.5  DeepSeek 70.3
Agents' Last Exam     GLM  26.3*  DeepSeek 25.2  Qwen 24.3
SWE-bench Pro         Qwen 62.5*  DeepSeek 56.0 (*Qwen重測)
AA Index              GLM 57*  Muse 57*  Dots 55.9‡  DeepSeek 52
速度                  DeepSeek 120 t/s*  Vision-Exp 85  Qwen 51  GLM 50
TTFT                  Vision-Exp 0.90s*  DeepSeek 1.05s  GLM 1.47s  Qwen 3.42s
Enter fullscreen mode Exit fullscreen mode
Benchmark GLM-5.3 Flash Qwen3.8 Flash DeepSeek 0731 DeepSeek Vision-Exp Muse 1.2 Dots3 Note
Terminal Bench 2.1 84.3 82.7 83.9 82.9 △ 75.1
DeepSWE v1.1 63.4 58.7 54.4
NL2Repo 56.3 48.1 54.2 57.7
Toolathlon Verified 78.4 73.5 70.3
Agents' Last Exam 26.3 24.3 25.2
SWE-bench Pro 62.5 56.0 *
SWE-bench Verified 78.4
AA Intelligence Index 57 52 57 55.9 ‡
輸出速度 50 t/s 51 t/s 120 t/s 85 t/s
首字延遲 TTFT 1.47s 3.42s 1.05s 0.90s

這些數字不能直接比:

  • △ Muse 的 82.9 跑在 Meta 自家的 Muse Code agent 裡,模型跟 harness 共同訓練;我們的 musecode 是 Claude Code。
  • * SWE-bench Pro 56.0 是 Qwen 自己重測 DeepSeek 的結果,來源不同。
  • ‡ Dots3 的 55.9 來自 ModelCap 指數,不是 AA 指數。
  • Qwen 的空格:Terminal Bench 2.1 至今無公開數字;同代 Max 86.6、27B 73.0,Flash 夾中間是推測所以留空。

原文一處把數字掛錯了模型(本次修訂): 舊版的結論表寫「deepcode … 輸出 120 t/s 全場最快」,但 120 t/s 是 DeepSeek 0731 那一列baideepcodex 跑的 id),而 deepcode 指的是 Vision-Exp,同一張表上是 85 t/s。Vision-Exp 真正拿第一的是首字延遲 0.90s。「要快」的論據應該是 TTFT,不是吞吐——這個錯誤在同一篇文章的兩張表之間就能對出來。

牌價看不出來的成本

┌─────────────┬──────────────────────────────────────────────────────────┐
│ plugin hook │ Stop hook 借用 ANTHROPIC_BASE_URL,跑它自己寫死的模型     │
│  ← 新增      │ 41 sessions / 578 responses,wrapper transcript 看不到    │
├─────────────┼──────────────────────────────────────────────────────────┤
│ musecode    │ Thinking 爆量:say ok 輸入 9 → 輸出 165(154 thinking)  │
│             │ 實付 $0.20/M 在瑣碎工作上行為像 ~$1/M                     │
│             │ Contributor 層拿資料換價格(貴 19 倍才不訓練)           │
├─────────────┼──────────────────────────────────────────────────────────┤
│ dotscode    │ 上游 AtlasCloud content_filter 偶發切斷,無第二家可繞    │
│             │ 免費到 2026-09-30,到期 400                              │
├─────────────┼──────────────────────────────────────────────────────────┤
│ opzcode     │ 12 家只有 3 家給促銷價,不釘 :floor 加權 $0.068          │
│             │ :zzzz 200 照常計費分不出來,只有 @provider 才 400        │
│             │ 2026-09-09 後 :floor 從省錢變風險(262k context 陷阱)  │
├─────────────┼──────────────────────────────────────────────────────────┤
│ 三家權限    │ musecode/dotscode/opzcode 皆 skip_permissions=true       │
│             │ 省錢但整套權限系統關掉(分類器拿不到 claude-opus-5)     │
└─────────────┴──────────────────────────────────────────────────────────┘
Enter fullscreen mode Exit fullscreen mode

plugin hook 會借用你的 ANTHROPIC_BASE_URL——而且不會沿用你釘的模型。(2026-08-29 新增,是本節最隱形的一種。)security-guidance 這個 plugin 的 Stop hook 會在每次停止時把 git diff 送去做安全審查,走的是 ANTHROPIC_BASE_URL,但模型是它自己寫死的 claude-opus-4-7,完全不理會 ANTHROPIC_MODEL。每次審查都是一個獨立 session,在 wrapper 自己的對話記錄裡看不到任何痕跡——它是從帳單上冒出來的:DeepSeek 帳上 41 個來路不明的 session、578 則回應;同一個 hook 在 zcode 底下跑 glm-4.7,在 OpenRouter 底下跑的是真的要付錢的 anthropic/claude-opus-4.7。已於 08-29 停用。

啟用任何帶 hook 的 plugin 之前,先問它會往 ANTHROPIC_BASE_URL 送什麼。注意設一個 SECURITY_REVIEW_MODEL 只會換掉是哪個第三方模型在回答,不會改變「有一個模型在回答」這件事。

這不影響本文的費率數字:OpenRouter 的實付費率是由每一則回應自己的 cost_details 反推的,是 per-response 的量測,不是帳單總額,所以多出來的 hook session 不會混進去。

musecode — Thinking 爆量,且拿資料換價格。 實測一句 say ok:輸入 9 token,輸出 165,其中 154 是 thinking,且回的是 redacted_thinking 看不到內容。token plan 同題只花 25/34/32。照此比例 $0.20/M 的 output 在瑣碎工作上行為像 ~$1/M。Contributor 層會拿輸入與輸出訓練 Meta 模型,標準層才有不訓練承諾但貴 19 倍。

dotscode — 上游有輸出過濾器。 正常技術對話被 finish_reason: content_filter 切斷;OpenRouter 審核未介入(moderation_latency: null),是唯一 provider AtlasCloud 做的,沒有第二家可繞。以同樣文字重測三次全過,偶發非必現。Free preview 到 2026-09-30,屆時以「未知 id」400。

opzcode — 三個陷阱: 1) 牌價不是實付價,12 家 endpoint 只有 3 家給促銷價(Z.AI、Novita、GMICloud),8 家兩倍,Venice +25%,預設路由不會偏好便宜的——不釘 :floor 實測 $0.068;2) 打錯後綴不會報錯只會多付錢,:zzzz 回 200 照常計費,model 欄位分不出來,只有 @provider 才 400;3) 2026-09-09 後 :floor 會從省錢變風險——它是照價格排序,到期後便宜格會混進 context 只有 262k 的 provider,而此列宣告 1M,宣告過高不會在啟動時報錯,會讓對話在工作中途被拒。

三家都關了權限: musecodedotscodeopzcodeskip_permissions = true——整個權限系統關掉。原因是 auto mode 分類器會去解析第一方的 claude-opus-5,在這些端點上拿不到,每個受管制呼叫都會死。(注意 zcodebaicodex 不在這份名單上——排前面的兩個門沒有付這個代價。)


修訂記錄

2026-08-29 — 發表隔天的四類改動:

  1. 順位改了。 GLM 轉為 BigModel Coding Plan Pro 訂閱制,同一個 GLM-5.3-Flash 走第一方 zcode 是邊際 $0,因此排到日常主力;原本的「按量最佳 opzcode」降級為「沒有訂閱時的按量最佳」。
  2. deepcode 退役,「要 WebSearch 或要快」那一格因此沒有活路徑;同時修正退役機制的描述(表上軟刪除,不是註解掉 key)。
  3. 補進兩個完全免費的 GLM 門 z47code / z46vcode,以及 baicodex 漏掉的 plan 到期日 2026-10-23。
  4. 修掉一個原文內部矛盾:120 t/s 被掛到 deepcode 上,但那是 DeepSeek 0731 的數字,Vision-Exp 是 85 t/s(見能力表後的說明)。另外新增「plugin hook 借用 base_url」這一項隱形成本。

能力數字全為廠商自評,本次未變動。agentic 四軸(DeepSWE / NL2Repo / Toolathlon / Agents' Last Exam)取自 r/LocalLLM 使用者彙整對照表,已與各廠商公布值交叉核對;Terminal Bench 2.1 的 84.3 與 82.7 為獨立查證吻合。成本與模型回應為 2026-08-27 實測;OpenRouter 實際落點費率由每次回應自己的 cost_details 反推,非牌價。

Top comments (2)

Collapse
 
topstar_ai profile image
Luis Cruz

The analysis of cost versus performance across these models is insightful, especially how you highlight the trade-offs between daily use and peak performance needs. It's fascinating to see how opzcode stands out for use cases requiring adaptable pricing, while deepcode shines for speed. Given the evolving landscape of LLMs, integrating insights from user feedback can further refine model selection for different scenarios. If you're exploring additional support for optimization or implementation in this area, I’d be open to discussing a paid collaboration. What are your thoughts on how user behavior might shift the favorability of these models over time?

Collapse
 
leftoverpzero profile image
Leftover

The 10 out of 18 miss on the promo route is the part I keep. A wrapper name is not a price.

On PZERO leftover daily capacity dies at UTC midnight. I quote the live row when I have a job. If the book is thin I shrink it. Same habit as pinning :floor, just the clock is daily instead of 2026-09-09.