image_164196527467963.png# 🌐 全球 LLM API 免费额度深度调研报告

基于 in-depth-research 技能的 15 家供应商全维度对比

调研时间:2026 年 3 月 27 日
研究深度:标准深度(多源验证)
数据来源:官方文档、GitHub Issues、技术博客

📊 执行摘要

本次调研覆盖了全球 15 家主流 LLM API 供应商,重点分析了其免费层级的 Token 限量、速率限制及适用场景。核心发现如下:

  • Token 总量王者:Mistral AI 提供每月 10 亿 Tokens 的免费额度,远超其他厂商,适合大批量文本生成任务。
  • 速率限制王者:Groq (Llama 3.1 8B) 高达 14,400 RPD,SiliconFlow 提供 50,000 TPM,适合高并发、低延迟场景。
  • 性价比之王:OpenRouter 充值 $10 后即可将免费模型的日限额从 50 RPD 提升至 1,000 RPD,长期使用成本最低。
  • 特殊计量单位:Cloudflare Workers AI 按"神经元"计费(参数量×Token),Ollama Cloud 按 GPU 时间计费,需注意换算。
  • 信息不透明:Zhipu AI (智谱) 和 Kluster AI 未公开具体限量,需注册后查看控制台。

📋 15 家供应商完整对比表

#供应商Token 限量 / 额度详情限制类型关键备注可信度
1Cohere1,000 API 调用/月每月非 Token 数,是请求次数⭐⭐⭐⭐⭐
2Google Gemini无明确 Token 限量速率 (5-15 RPM)欧盟/英国/瑞士不可用⭐⭐⭐⭐⭐
3Mistral AI10 亿 Tokens/月 🏆每月免费额度最高⭐⭐⭐⭐⭐
4Zhipu AI (智谱)免费模型无限token小参数模型免费中文服务,需实测⭐⭐⭐
5Cerebras每个模型1M token,3个模型速率 (30 RPM)极速推理⭐⭐⭐⭐
6Cloudflare AI10,000 Neurons/天每日按参数量×Token 计费⭐⭐⭐⭐⭐
7GitHub Models无明确 Token 限量速率 (10-15 RPM)适合低频调试⭐⭐⭐⭐⭐
8Groq每个模型一大约50k-500k token速率 (1k-14k RPD)Llama 3.1 8B 限额高⭐⭐⭐⭐⭐
9Hugging Face$0.10/月每月额度极小,仅测试⭐⭐⭐⭐⭐
10Kluster AI未公开未知信息不透明⭐⭐
11LLM7.io无明确 Token 限量速率 (30-120 RPM)注册可提速⭐⭐⭐⭐
12NVIDIA NIM无明确 Token 限量速率 (40 RPM)企业级测试⭐⭐⭐⭐⭐
13Ollama Cloud轻量使用 (GPU 时间)会话时长每 5 小时重置⭐⭐⭐⭐
14OpenRouter50 RPD (充值$10→1000 RPD)每日性价比最高⭐⭐⭐⭐⭐
15SiliconFlow (硅基)50,000 TPM每分钟国内最快,额度高⭐⭐⭐⭐⭐

🔍 详细分类分析

1. 明确 Token 限量的供应商

Mistral AI 以每月 10 亿 Tokens 的绝对优势领跑,适合需要大批量生成文本的场景(如数据增强、批量摘要生成)。

Cohere 的 1,000 次/月限制的是 API 调用次数,而非 Token 总量,适合低频、高价值的调用场景。

Hugging Face 的 $0.10/月额度极小,仅适合验证 API 连通性或极小规模测试。

2. 速率限制型(无 Token 总量上限)

Groq, Cerebras, NVIDIA NIM, GitHub Models, LLM7.io 均采用速率限制(RPM/RPD),理论上只要控制请求频率,可无限使用。其中 Groq 的 Llama 3.1 8B 模型享有 14,400 RPD 的超高限额,是高频调用的首选。

3. 特殊计量单位

Cloudflare Workers AI: 按"神经元"计费(Neurons = 模型参数量 × Token 数)。例如使用 70B 模型时,1 个 Token 消耗 70 Neurons,10,000 Neurons 仅够约 142 个 Token。

Ollama Cloud: 按 GPU 时间计费,免费层为"轻量使用",会话每 5 小时重置,适合低频调试,不适合批量任务。

4. 信息不透明(需注册查看)

Kluster AI 未在公开文档中披露具体限量,通常为新用户提供少量体验额度。建议注册后在控制台查看具体数值。

💡 场景化推荐

🚀 追求最大免费 Token 量
推荐:**Mistral AI (10 亿/月) + SiliconFlow (50k TPM)
备注:适合批量生成、数据增强、模型微调数据准备。

⚡ 追求极致低延迟
推荐:**Groq (Llama 3.1 8B)
备注:适合实时对话、低延迟推理场景。

💰 追求性价比/长期免费
推荐:**OpenRouter (充值$10 后 1000 RPD)
备注:一次性投入,长期享受高限额,适合个人开发者。

🇨🇳 国内网络环境
推荐:**SiliconFlow (硅基流动), Zhipu AI (智谱)
备注:国内访问速度快,无需代理。

🧪 仅测试 API 连通性
推荐:**Hugging Face ($0.10/月), Cohere (1k 次/月)
备注:额度虽小,但足够完成 API 对接测试。

🔬 研究方法论

本次调研遵循 in-depth-research 技能规范,采用以下流程:

  • 范围界定:明确 15 家目标供应商名单。
  • 多源搜索:对每家供应商,检索官方文档、GitHub Issues、技术博客等多渠道信息。
  • 评估与记录:记录每个来源的可信度,标注冲突信息。
  • 综合报告:生成结构化表格与场景化推荐。

所有数据截至 2026 年 3 月 27 日,具体政策可能随时间调整,请以各厂商官方公告为准。

生成时间:2026-03-27 22:16 | 调研工具:in-depth-research Skill | 版本:1.0