要點速覽
- 這裡哪一個的標價最低? DeepInfra 的 Llama 3.1 8B Instruct Turbo 每百萬輸入 token 收費 $0.02、輸出 token 收費 $0.04。但這只是其目錄中一款小模型的價格。
- 需要存取多個模型系列,選哪家? DIT 用一個 API 金鑰存取多個開發者的受支援模型。其目錄列出的 GLM 5.3 Flash 價格為每百萬輸入 token $0.12、輸出 token $0.40;使用前請核實實際收費。
- 程式設計任務該測試哪個 API? 用自己的程式設計任務比較 DIT 的 GLM 5.3 Flash、DeepSeek Flash,以及 Groq 或 Together AI 上合適的模型。每 token 更便宜,不代表每次成功修改的成本更低。
- 有沒有對所有任務都最便宜的 AI API? 沒有。模型選擇、輸出量、快取、處理檔位和品質要求都會影響最終帳單。
最便宜的 AI API 供應商一覽
下表列出截至 2026 年 10 月 8 日各服務公佈的美元價格,單位均為每百萬輸入或輸出 token。範例採用不同模型,因此這是服務商候選清單,而非同等能力模型的排名。除特別註明外,均為標準付費同步呼叫價格。採購前請先核對最新報價;DIT 的即時模型目錄顯示目前可用的市場價格。
| 服務商 | 範例模型 | 輸入 / 百萬 token | 輸出 / 百萬 token | 適用場景 |
|---|---|---|---|---|
| DIT | GLM 5.3 Flash | $0.12 | $0.40 | 透過一個 API 存取受支援模型及市場路由 |
| DeepInfra | Llama 3.1 8B Instruct Turbo | $0.02 | $0.04 | 本次比較中最低的模型入門價格 |
| Groq | GPT-OSS 20B | $0.075 | $0.30 | 適合受支援開放模型的快速回應 |
| Together AI | Qwen3.8 Flash | $0.15 | $0.47 | 託管開放模型選擇豐富 |
| Google Gemini API | Gemini 2.5 Flash-Lite | $0.10 | $0.40 | 低成本多模態及長上下文任務 |
| DeepSeek API | DeepSeek V4.1 Flash(非尖峰時段) | $0.15 | $0.60 | 直接呼叫程式設計與推理模型 |
DeepSeek 對這款模型公佈的高峰時段價格為每百萬輸入 token $0.30、輸出 token $1.20。 DIT 的目錄和模型詳情頁目前顯示不同的 GLM 5.3 Flash 輸出價格;表格採用目錄報價,購買前請核實實際收費。表格未計入免費額度、批次價格、快取輸入、工具費用和稅金。各範例模型的能力也不同:小型指令模型不能直接取代程式設計 Agent。
六家經濟實惠的 AI API 供應商
DIT:以市場價格存取多家模型服務商
DIT 是面向團隊的 AI token 交易平台:一個 API 金鑰和相容端點即可呼叫支援模型。平台根據價格、品質和可用性訊號評估合格的供應路由。如果應用程式將來需要切換模型或供應商,這種方式可以減少重複整合。
以具體價格為例,DIT 的模型目錄將 GLM 5.3 Flash 列為每百萬輸入 token $0.12、輸出 token $0.40。模型詳情頁將程式設計、工具呼叫和長上下文任務列為適用場景,但目前顯示了另一項輸出價格。這是某款模型的報價,不代表 DIT 比所有直連或託管 API 都便宜。使用前還應核對實際收費、端點支援和可用路由。
適合: 需要存取多個模型系列,或希望不另建供應商整合就測試替代供應路由的應用。 注意: 路由層仍須滿足延遲、功能、隱私和可靠性要求。如果某款模型只有一條合格路由,該要求就無法享受供應商故障切換。
用 DIT 建構低成本 API 方案:
- 建立 DIT API 金鑰,選擇一款符合任務品質要求的支援模型。
- 將 OpenAI 相容客戶端的 base URL 設為
https://api.dit.ai/v1,發送一組具代表性的請求。 - 比較實際收費、回答品質、延遲和任務完成情況,再逐步遷移更多流量。
DeepInfra:小型開放模型的低費率
DeepInfra 的 Llama 3.1 8B Instruct Turbo 標價為每百萬輸入 token $0.02、輸出 token $0.04,是本文範例模型中最低的付費 token 價格。它還提供 OpenAI 相容 API,已有此類請求格式的團隊可以降低整合工作量。
適合: 分類、資訊擷取、簡短回答,以及小模型能通過品質檢查的任務。 注意: 低價僅對應特定的 8B 模型。複雜程式設計任務可能需要更昂貴的模型,或因反覆重試而增加成本。
Groq:支持模型的快速反應
Groq 將 GPT-OSS 20B 標為每百萬輸入 token $0.075、輸出 token $0.30,並公佈了這款模型約每秒 1,000 個輸出 token 的生成速度。如果互動功能需要快速回應,且模型能力符合任務要求,可以將它納入測試。
適合: 反應速度要求較高的助手、簡單程式碼輔助,以及適合 Groq 目前模型目錄的高流量任務。 注意: 核對具體模型、速率限制、上下文視窗及工具支援。生成快,不等於結果有用,也不一定讓總成本更低。
Together AI:廣泛的託管模型選擇
Together AI 為多種開放模型提供 Serverless 推理,也為有需要的團隊提供專用算力。其目前價格表顯示,Qwen3.8 Flash 每百萬輸入 token $0.15、輸出 token $0.47。豐富的模型選擇便於測試:能力稍強的模型能否減少錯誤,並抵消更高的 token 單價?
適合: 正在評估多款開放模型,或準備從彈性 Serverless 流量轉向專用吞吐量的團隊。 注意: 不同模型與部署方式的價格與功能各異。確認所選端點支援應用所需的工具、上下文長度和輸出格式。
Google Gemini API:低成本多模態任務
Google 的標準付費檔中,Gemini 2.5 Flash-Lite 每百萬輸入 token $0.10、輸出 token $0.40。它接受文字、圖像和視訊輸入;Google 也提供受各模型限制約束的免費用量。如果任務可以等待,批次還有更低的公佈價格。
適合: 同時處理文字和其他輸入形式的高流量輕量任務,或 Google 模型系列中的長上下文實驗。 注意: 免費額度,以及音訊、快取、儲存和 grounding 的計費規則,可能不同於普通文字請求。把免費或批次價格用於生產預算前,應先核對計費單位。 AI 模型 API 定價指南介紹了實用的比較方法。
DeepSeek API:程式設計與推理的直接 API
DeepSeek 目前的 Flash 模型為 DeepSeek V4.1 Flash,呼叫時使用 deepseek-flash 模型 ID。公佈的非尖峰時段價格為每百萬輸入 token $0.15、輸出 token $0.60;高峰價格是其兩倍。 API 文件列出了工具呼叫、JSON 輸出、大上下文窗口,以及 OpenAI 和 Anthropic 請求格式。
適合: 希望直連 API 完成程式設計、工具型 Agent 和推理任務的團隊。 注意: 最低價格取決於請求時段,以及快取輸入是否符合單獨計價條件。配置新應用程式時,請使用目前模型 ID,而非舊的 V4 Flash 別名。
最便宜的程式設計 AI API:如何選擇?
對於常規程式碼解釋、格式化和小範圍修改,先選一款低成本模型,再用測試或人工審查衡量結果。可以比較 Groq 的 GPT-OSS 20B、Together AI 的 Qwen3.8 Flash 和 DIT 的 GLM 5.3 Flash。 DeepInfra 的 8B 範例對簡單機械任務可能足夠便宜,但標價無法說明它處理多檔案修改的能力。
對於調試、工具呼叫循環和整個程式碼庫的修改,請比較 DIT 上適合程式設計的模型、DeepSeek Flash,以及其他支援所需上下文和工具的模型。讓它們完成同一組任務,記錄成功修改、重試、人工修正、輸入輸出 token 和延遲。按每個合格結果的成本選擇,並在工作負載變化時重新評估。 DIT 的模型路由策略指南介紹了這項決策涉及的價格、品質和可用性訊號。
如何為您的工作負載選擇最便宜的 LLM API 供應商
先按具體任務篩選。小模型若能穩定完成輕量請求,就是合理選擇;若某款模型的原生功能不可或缺,直連供應商可能更合適。當你需要透過一次整合來比較多個支援模型或供應路由時,多供應商服務更有價值。 DIT 的網關與直連 API 比較指南解釋了這項運維取捨。
然後用代表性提示詞估算帳單:輸入 token × 輸入單價,加上輸出 token × 輸出單價,再計入快取輸入、重試和額外費用。以總支出除以成功結果數。這樣能發現標價很低、失敗成本卻很高的方案。選定服務商後,也可參考LLM API 成本優化進一步降低費用。
最便宜的 AI API 供應商,是能夠以最低實測成本滿足品質和運作要求的那一家。保持價格表更新,並在模型、流量結構或服務條款變更後重新比較。
使用一個 DIT 金鑰通過合格 AI 供應商市場訪問支持的模型。
獲取您的 API 金鑰



