Claude Fable 5.1 深度分析:能力、價格與 Fable 5 比較
依官方資料與即時目錄,分析 Claude Fable 5.1 能力、Modelflare 三條路由價格、Fable 5 差異、API 遷移限制與選型方法。
Claude Fable 5.1 是面向高難度推理與長程 Agent 工作的前沿模型。Modelflare 現已透過三個公開價格群組提供準確模型 ID claude-fable-5-1。真正需要做的選擇,不是籠統判斷 Fable 5.1 是否「最好」,而是依照自己的工作負載選擇合適的路由與推理強度,讓一次完整任務的成本與風險都可控。
先給結論: 如果任務涉及倉庫級程式設計、多步驟研究、文件密集型分析,或需要連續執行數小時的 Agent,優先考慮 Fable 5.1。日常問答和對延遲敏感的任務,可以繼續使用 Fable 5 或更輕量的模型。下方價格是 2026 年 9 月 2 日核驗的 Modelflare 使用者側實際價格;價格頁始終是最終準確資訊源。
本文明確區分 Anthropic 官方資料、Modelflare 即時目錄、廠商自行報告的基準,以及本文分析。基準分數或已配置的模型條目,都不保證每個提示詞、工具或協定的行為完全一致。
核心結論
Fable 5.1 在名稱上是一次小版本升級,在工作流程上卻更像一次重要迭代。它保留了 Fable 5 的 1M Token 上下文、128K 最大輸出和始終開啟的自適應思考,同時加強了長程程式設計、多步驟研究、文件與試算表處理、投影片生成、視覺理解和電腦操作。Anthropic 還降低了 API 的快取讀取價格。
在 Modelflare 中,三條路由把成本與連續性的選擇說清楚:
- claude-premium:穩定性優先。
- claude-award:價格優先,適合可以安全重試的任務。
- claude-stable:個人開發者和正式環境工作負載的日常選擇。
它並不是所有自建 Messages 用戶端的無感升級。強制工具呼叫會被拒絕,Fable 5.1 的思考區塊對歷史繫結更嚴格,而且長迴圈中可能比 Fable 5 發出更少的平行工具呼叫。切換長程 Agent 前,應先做協定級遷移測試。
關鍵事實與目前價格
下表的模型事實來自 Anthropic Fable 5.1 模型概覽 與 更新說明。Modelflare 欄位於 2026 年 9 月 2 日透過即時 /api/pricing 回應核驗。
| 屬性 | Fable 5.1 |
|---|---|
| 模型 ID | claude-fable-5-1 |
| 上下文視窗 | 1M tokens |
| 最大輸出 | 128K tokens |
| 思考模式 | 自適應,始終開啟 |
| 預設 effort | high |
| 相對延遲 | 較慢 |
| 知識截止時間 | 2026 年 6 月 |
| 官網 API 輸入/輸出 | 每 1M tokens:$10 / $50 |
| 官網快取讀取 | 每 1M tokens:$0.25 |
Modelflare 站內路由價格
以下是目前 Modelflare 使用者側價格,不是 Anthropic 直連官網價。金額均為每 1M tokens 的美元價格,輸入與輸出分別計費。
| 路由 | 倍率 | 輸入 | 輸出 | 定位 |
|---|---|---|---|---|
| claude-premium | 0.5x | $5.00 | $25.00 | 優先保障穩定性與請求成功率 |
| claude-award | 0.25x | $2.50 | $12.50 | 最低成本,適合可重試開發與測試 |
| claude-stable | 0.315x | $3.15 | $15.75 | 日常開發與正式環境使用 |
目前模型條目報告快取讀取倍率為 0.025;快取和其他用量維度應以即時價格頁及完成後的用量記錄對帳。不要在不檢查目前路由、快取狀態和計費模式的情況下,把表格直接用於成本預測。
Fable 5.1 與 Fable 5 比較
Anthropic 將 Fable 5.1 定位為 Fable 5 的後繼版本,而不是全新的模型家族。實際差異主要集中在長任務表現,以及反覆讀取穩定提示詞前綴時的成本。
| 維度 | Fable 5.1 | Fable 5 | 對開發者的含義 |
|---|---|---|---|
| 上下文與輸出 | 1M / 128K | 1M / 128K | 無需遷移容量設定 |
| 自適應思考 | 始終開啟 | 始終開啟 | 保留思考區塊並使用 effort 控制 |
| 輸入與輸出價格 | 每 1M:$10 / $50 | 每 1M:$10 / $50 | 基礎價格不變 |
| 快取讀取 | 官網每 1M:$0.25 | 官網每 1M:$1 | 長 Agent 迴圈重讀前綴更便宜 |
| 程式設計 | 多檔案修改、重構、除錯和驗證更強 | 長程程式設計能力強 | 重新執行倉庫級評測 |
| 研究與工件 | 多步驟研究、文件、試算表和投影片更好 | 能力強,但長鏈路一致性稍弱 | 提供明確檢查點和來源要求 |
| 工具與歷史 | 拒絕強制工具呼叫,思考區塊繫結更嚴格 | 約束較少 | 遷移前更新自建 Messages 用戶端 |
| 多語言 | 與 Fable 5 相當 | 基線 | 不要假設新增語言優勢 |
這不是「同一張帳單換來更多智能」這麼簡單。快取讀取占主導時,長任務可能更便宜;但更慢的模型或額外工具輪次也可能提高牆鐘成本。應把重試和人工審核一起納入完整任務測量。
能力分析
長程程式設計
當一次修改跨越多個檔案、服務、測試和文件時,Fable 5.1 的差異最明顯。Anthropic 描述了多日自主工作階段、程式碼審查、效能工作、按設計實作功能,以及用視覺檢查結果。更有價值的變化是根因修復:模型更傾向追蹤失敗測試或罕見崩潰的底層缺陷,而不是只打補丁讓表面症狀變綠。
這並不意味著無人值守執行程式碼天然安全。應給 Agent 限定工作區、明確審批點、測試預算和回滾路徑;要求它列出修改檔案與檢查項,並把最終 diff 和測試輸出保存在模型工作階段之外。
研究與知識工作
該模型被設計為把問題依次推進到檢索、證據收集、分析和最終工件。對於研究備忘錄、帶公式的試算表、投影片提綱,或前後結論相互依賴的財務與營運審查,它是很合適的候選。
主要風險是證據漂移。在低 effort 下,模型可能減少搜尋而更多依賴記憶。應要求它給出來源連結、日期,以及「什麼證據會改變結論」一節。廠商示例和客戶引語只能作為定性證據,不能當作獨立基準。
視覺與電腦操作
Fable 5.1 可以讀取密集圖表、PDF 內嵌表格和文件版面,也能用視覺把生成的介面與原始目標進行比較。這對設計審查、財務報表、架構圖和瀏覽器工作流程很有用。
視覺理解不等於像素級正確。重要區域應單獨裁剪;多輪請求中保持原始檔案位元組不變;小字號和座標要獨立測試。電腦操作必須置於應用層授權之後,並為不可逆動作保留人工停止點。
多語言輸出
Anthropic 表示 Fable 5.1 的多語言表現與 Fable 5 相當。Modelflare 的文章和價格頁面支援本地化,但模型品質仍取決於提示語言、來源語言、術語和輸出約束。多語言產品應把名稱、單位、程式碼識別碼和法律術語固定在術語表中,再用同一組任務評測每個目標語言。
如何閱讀基準
下表重現 Anthropic 公開比較。分數由廠商報告,並啟用了公告中描述的生產安全措施,應作為方向性證據,而不是 Modelflare 的保證。
| 基準 | Fable 5.1 | Fable 5 | 解讀 |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | Agent 科研任務的報告增幅較大 |
| Terminal-Bench 4.0 | 55.8% | 42.0% | 公布的終端程式設計測試更高 |
| GDPval-AA v2 | 1853 | 1723 | 知識工作分數更高 |
| OSWorld 2.0,partial | 77.9% | 72.9% | 電腦操作提升,但受安全攔截影響 |
| OSWorld 2.0,strict | 41.7% | 36.1% | 絕對分數較低,方向一致 |
| Humanity's Last Exam,無工具 | 60.9% | 57.8% | 推理能力中等幅度提升 |
| Humanity's Last Exam,有工具 | 65.0% | 63.8% | 工具有幫助,但不是普遍勝出 |
| AutomationBench | 31.4% | 17.1% | 公布的業務工作流程結果更強 |
| CursorBench 3.2.0 | 73.4% | 70.5% | 程式設計 Agent 結果更高 |
Anthropic 提到,安全攔截可能拉低分數,包括 OSWorld 和 AutomationBench 中部分任務得到零分。評測框架、effort、工具權限、逾時和重試策略都會改變結果。公平的內部比較應回放同一組隱私安全任務,並報告成功任務成本、延遲、重試和人工修正,而不只是最高基準分數。
API 與遷移注意事項
目前 Modelflare 即時目錄將 claude-fable-5-1 標記為支援 Anthropic 與 OpenAI 相容入口。端點可用不代表功能完全一致;請核對用戶端實際需要的串流事件、工具 schema、結構化輸出和視覺輸入。
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
curl -sS https://modelflare.dev/v1/messages \
-H "x-api-key: ${MODELFLARE_API_KEY}" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-fable-5-1",
"max_tokens": 512,
"messages": [{"role": "user", "content": "列出這份遷移計畫中的三個風險。"}]
}'
從 Fable 5 遷移自建 Messages 整合時:
- 刪除 tool_choice 的 any 和 tool 值,改用自動工具選擇配合嚴格 schema 或結構化輸出;
- 保留思考區塊時,把會話當作只追加歷史處理;
- 除非使用 API 的會話中機制,否則不要在輪次之間重建 system prompt 或工具列表;
- 只有測量過快取與延遲影響後,再使用逐訊息 effort beta;
- 長迴圈中預期平行工具呼叫更不穩定、進度更新更少;
- 把 stop_reason: "refusal" 的拒答當作成功返回來處理,再執行有界 fallback 策略。
模型不會返回原始思維鏈。如果介面需要進度資訊,請明確請求面向使用者的更新,並將其與隱藏推理分開。
如何選擇 Modelflare 路由
路由應由失敗成本決定,而不是由一張統一品質榜決定。下面用 100K 輸入 Token 與 10K 輸出 Token 做簡單算例,不含快取、重試和其他費用:
| 路由 | 計算 | 任務費用約值 |
|---|---|---|
| claude-premium | 0.1 × $5 + 0.01 × $25 | $0.75 |
| claude-award | 0.1 × $2.50 + 0.01 × $12.50 | $0.375 |
| claude-stable | 0.1 × $3.15 + 0.01 × $15.75 | $0.4725 |
失敗一次代價很高或連續性最重要時,使用 claude-premium。開發、批次探索和可以安全重試的任務,使用 claude-award。個人開發者、長期專案或正式環境整合,可把 claude-stable 作為均衡預設選項。高並發前請重新查看價格頁。
安全、限制與資料處理
Fable 5.1 包含針對網路安全和生物領域的安全分類器。部分被標記的請求可能被拒絕或轉給能力較低的 fallback;Anthropic 說明拒答可能以 HTTP 200 和 stop_reason: "refusal" 返回。重試與計費邏輯必須把拒答和傳輸錯誤分開。
Anthropic 將 Fable 5.1 列為 Covered Model。除非企業獲得批准的特殊安排,Claude API 預設保留資料 30 天。不要因為上下文很大就傳送金鑰或受監管資料。應使用最小權限工具、脫敏日誌、執行時限和可稽核用量記錄。
該模型比輕量 Claude 選項更慢,1M Token 上限也不意味著每個位置都同樣容易檢索或便宜。新一代 tokenizer 對同一文本可能比舊模型多產生約 30% 的 Token。成本預算應以用量記錄為準,而不是只看字元數或上下文上限。
常見問題
Fable 5.1 是否總是優於 Fable 5? 不一定。它更適合長程任務,但日常工作中 Fable 5 可能更快或已經足夠。請評估完整任務和重試模式。
哪個 Modelflare 路由最便宜? 目前 claude-award 倍率最低,為 0.25x,適合能夠容忍重試或可用性波動的工作。
正式環境應該用哪個路由? 可以先用 claude-stable 作均衡預設;如果連續性和請求成功率的業務價值高於價格,則選擇 claude-premium。
Fable 5 的工具迴圈能否原樣重用? 不建議。強制工具呼叫會報錯,思考區塊歷史繫結更嚴格,平行工具呼叫行為也可能不同,應執行真實多輪測試。
一次文字請求成功,是否證明視覺或工具可用? 不能。應分別測試每種模態和協定,包括串流、拒答、取消和畸形輸入。
來源與更新記錄
- Anthropic:Introducing Claude Fable 5.1 and Claude Mythos 5.1
- Claude Fable 5.1 模型概覽
- What's new in Claude Fable 5.1
- 遷移到 Claude Fable 5.1
- Modelflare 即時價格
- Modelflare 可靠路由指南
- Modelflare Token 成本追蹤指南
更新記錄: 2026 年 9 月 2 日——初稿;Modelflare 模型可用性、三條路由倍率和使用者側輸入/輸出價格均已透過即時目錄核驗,Anthropic 規格與基準值已透過連結的一手頁面核驗。本文不聲稱獨立重現基準。