前言

玩 AI 不一定要花钱。我实测了市面上 8 个可以免费调用大模型 API 的平台,覆盖了文本生成、多模态、视频生成、超长上下文等不同场景。每个平台都标注了推荐模型、免费额度、API 格式和接入方式,拿到 Key 就能跑。

1. NVIDIA Build — 一个 Key 吃遍 189 个模型

推荐模型: step-3.5-flash(50 tok/s,速度最快)、GLM-4.7(编程和工具调用)、Qwen3.5122B(推理+多模态)

免费额度: 免费模型不限调用次数,付费模型每月 1000 Credits

API 格式: OpenAI 兼容,改个 base_url 就行

NVIDIA Build 最大的优势是模型覆盖面广。不只是文本模型,OCR 图片识别、语音对话、文生图、实时语音转文字都在一个平台上搞定。多模态覆盖度在免费平台里是最全的。

注意: 高峰期排队比较严重,大参数模型可能等 1-2 分钟。日常轻量任务推荐 MiniMax-M2.5 和 GLM-4.7,实测 30-40 tok/s。如果跑定时任务,晚上体验最好。

export NVIDIA_API_KEY="你的Key"
# OpenAI 兼容格式
base_url = "https://integrate.api.nvidia.com/v1"
model = "stepfun-ai/step-3.5-flash"

2. 智谱 AI — 免费模型里最稳的选手

免费模型:

  • GLM-4-Flash-250414 — 128K 上下文,16K 输出
  • GLM-4.6V-Flash — 128K 上下文,视觉理解
  • GLM-4.7-Flash — 200K 上下文,128K 输出(免费模型里最大)

限制: 并发 30,没有 RPM 频率限制。

这是个非常重要的区别——大部分平台限制每分钟请求数(RPM),但智谱只管同时有多少个请求在跑。如果你跑的是定时任务或批量处理,每分钟发 200 次请求但每次 50ms 就返回,智谱不会拦你。对 OpenClaw 这类需要高频调用的工具来说,这是最佳搭档。

base_url = "https://open.bigmodel.cn/api/paas/v4"
model = "glm-4.7-flash"
# OpenAI 兼容格式,直接换 base_url 和 api_key

另外,智谱的 CogVideoX-Flash 可以免费生成 4K 60fps 视频,在所有免费平台里是独一份。

3. Google AI Studio — Gemini 免费体验

免费模型: Gemini 2.5 Flash / Pro

Gemini 2.5 Pro 的能力在闭源模型里属于第一梯队,免费能用确实很香。适合做实验和原型开发。

注意两个坑:

  1. 配额按 Project 分配,不按 Key。开 5 个 Key 额度不会叠加。很多人在这里踩坑。
  2. 数据可能被用于模型训练,官方隐私政策写得很清楚。开发测试没问题,正式业务数据别往里放。

4. GitHub Models — GPT-4o 不绑卡就能用

门槛: GitHub 账号即可,不绑信用卡,不需要任何网络工具。

免费模型: GPT-4o-mini、Llama 系列、Phi 系列

限制: 15 RPM(每分钟 15 次)、150 RPD(每天 150 次)

一天 150 次够你调试一个完整的功能模块了。偶尔需要调用 GPT 系列模型的时候,不用翻墙、不用绑卡,直接上。

5. 硅基流动 — DeepSeek-V3 免费 + 国内低延迟

免费模型: DeepSeek-V3、Qwen3 系列

限制: 1000 RPM

DeepSeek-V3 的推理能力在开源模型里排第一梯队。国内服务器延迟低,适合对响应速度有要求的项目。1000 RPM 的配额对大部分中小项目来说绰绰有余。

base_url = "https://api.siliconflow.cn/v1"
model = "deepseek-ai/DeepSeek-V3"

6. OpenRouter — 100 万 Token 上下文

独家免费: Qwen 3.6 Plus,100 万 token 上下文窗口

100 万 token 是什么概念?一整本《红楼梦》放进去还有余量。如果你需要处理超长文档、批量分析大型代码库,这个上下文窗口在免费模型里没有对手。

API 是 OpenAI 兼容格式,一个端点切换所有模型,统一聚合了多个平台的模型,按需切换很方便。

7. Groq — 60 tok/s 的极速推理

速度: 60 tok/s,是大部分平台的 2-3 倍

免费模型: Llama 4 Scout、Mixtral 8x7B 等开源模型

限制: 1000 次/天

Groq 自研了 LPU(Language Processing Unit)芯片,专门为 LLM 推理优化。60 tok/s 意味着 AI 对话几乎没有等待感,实时交互场景(聊天机器人、语音助手)体验会好很多。

8. Cloudflare Workers AI — 每天 10000 Neurons

覆盖: LLM、图像生成、语音识别、翻译,多模态全覆盖

配额: 每天 10000 Neurons(计算单位,不是 Token)

适合已经在用 Cloudflare 生态的开发者。Workers 函数和 AI 模型无缝集成,部署一条龙。

怎么选?看你需要什么

说了 8 个平台,如果只选 1-2 个日常高频使用——

追求稳定不限频: 智谱 AI 的 GLM-4.7-Flash。只限并发不限频率,200K 上下文窗口,国内访问稳定,是定时任务和自动化脚本的最佳搭档。step-3.5-flash 也是首选,50 tok/s,非常稳定可靠。

需要模型多样性: NVIDIA Build,189 个端点随你选。

追求速度: Groq,60 tok/s 独一档。

需要超长上下文: OpenRouter 的 Qwen 3.6 Plus,100 万 token。

需要 GPT-4o: GitHub Models,不绑信用卡就能用。

三个坑提前说

  1. 配额按 Project 不按 Key。 Google AI Studio 这个机制最容易误解。注册 10 个账号不会给你 10 倍额度,只会给你 10 个被封的风险。
  2. 免费 ≠ 安全。 没有明确隐私声明的第三方平台,别接生产流量。开发测试没问题,跑正式业务数据还是老老实实付费。
  3. 搞清楚 RPM / TPM / TPD。 RPM 是每分钟请求数,TPM 是每分钟 Token 数,TPD 是每天 Token 数。不同平台限制维度不一样,被限流先看自己超了哪个。

文档汇总

平台文档地址
NVIDIA Buildbuild.nvidia.com/models
智谱 AIdocs.bigmodel.cn
Google AI Studioaistudio.google.com
GitHub Modelsgithub.com/marketplace/models
硅基流动siliconflow.cn
OpenRouteropenrouter.ai/models
Groqconsole.groq.com
Cloudflare Workers AIdevelopers.cloudflare.com/workers-ai