免费 AI API 全景指南
AI API FIELD GUIDE · 2026

2026 免费 AI API 全景指南 A Field Guide to Free AI APIs — Quotas, Costs & Who Each One Fits

想用大模型,又不想先掏钱?这么想的人不止你一个。翻一遍各家平台的页面,处处都写着「免费」,可真注册起来才知道各有门道:有的要绑卡,有的额度半天就用完,有的条款说变就变。这篇指南帮你把这件事一次弄明白——先给当前市场上的免费 AI API 做一套完整分类,再逐家拆开看:它是什么、属于哪一类、优缺点、怎么上手、以及适合什么样的人。覆盖六家国际平台、一家本地部署工具和两家中国平台,数据核对于 2026 年 9 月,以各家控制台实时显示为准。

核稿日期:2026-09-30 覆盖平台:6 家国际 + 2 家中国 + 1 家本地 阅读时长:约 16 分钟
先说清楚 · 「免费」的定义与五种形态

这篇文章说的「免费」,指不付钱就能调用模型 API,但它有五种形态,能做的事完全不同。限速型永久免费,按每分钟多少次、每天多少次设限,不超速就能一直用;储值型送一笔试用金,用完即止;池化型额度永久,但免费的是轮换的模型池;用户分摊型对开发者免费,费用记在最终用户的账号上;本地部署没有限额概念,代价是自己的硬件。后文每家的标签都会标出它属于哪一种;此外免费背后还有另一重代价——训练数据、账号注册或硬件。先分清形态,再谈额度。

01

全文概况与详细分类

Overview & Classification

先看一张总表掌握全貌,再用四个维度把当前市场的免费 AI API 分门别类:按接入方式、按免费形态、按地域与网络接入、按接口兼容性。

DIM 0

一表总览

The Map at a Glance
平台接入方式免费额度(要点)适合人群核心代价
A2Agent 聚合平台 无免费层;按 token 预付费,充值活动如有以官网为准 开发者日常调用、其他平台免费额度用尽后的付费备选 需充值;模型价格和活动条款可能变化
Google Gemini需特殊网络 官方开发者平台 无需信用卡;官方已不公布静态限额,以控制台为准,Flash 系列具体请求限额随模型和项目变化 第一个 AI 项目、多模态需求 免费层数据用于训练(EEA / 瑞士 / 英国除外)
Groq 推理加速平台 30 次/分钟 · 1,000 次/天 · 20 万 token/天,无卡 低延迟交互、现成 OpenAI 代码 模型少、轮换快,老教程代码会失效
SambaNova 推理加速平台 Llama 3.3 70B:20 次/分钟 · 20 次/天 · 20 万 token/天(按模型计算),无卡 免费体验 Llama 3.3 70B 等开源模型 日请求数只有 20 次
Cerebras 推理加速平台 约 100 万 token/天,无卡;请求限速口径不一,以控制台为准 长文档、批量文本处理 免费模型阵容经常变动
OpenRouter 聚合平台 免费模型约 50 次/天;每分钟及充值后限额以官方定价页和账号面板为准 横向对比模型、选型评测 免费模型池轮换;上游模型的数据政策需逐一核对
Puter 聚合平台 对开发者免费;AI 费用由最终用户账号承担,新账号送起始额度 网页应用、前端开发者 终端用户需登录并承担用量;也支持 Node.js
LM Studio本地 本地部署 无任何限额,实际能力取决于本地硬件 数据敏感、离线、内网环境 需要自己的显卡 / 内存
智谱 BigModel 官方平台(中国) 当前免费模型与新用户赠额以官方定价页为准 中国学习者、Agent 跑量 赠送额度条款以官方为准
阿里百炼 官方平台(中国) 合资格模型通常各有 100 万 token 新人额度,90 天有效 中国模型横向试用 90 天过期,仅北京地域

注:九家独立选项之外,表中另列无免费层的 A2Agent 付费网关;本文由 A2Agent Team 维护。额度来自官方文档和 2026 年 9 月的核实资料,部分内容于 10 月 8 日更新;实际数字以控制台为准。点击平台名称可跳转到详细介绍。

DIM 1

分类维度一:按接入方式

By Access Method

按「从哪里接入、模型在哪里运行」分四类:官方开发者平台、推理加速平台、聚合平台、本地部署。

官方开发者平台Official Developer Platforms

Google Gemini智谱阿里百炼

模型厂商自己的开发者网站,注册后直接调用自家模型。免费层面向个人开发者,用于试用和开发;额度相对慷慨(如 Gemini 的多模态、智谱的免费模型);数据使用条款则因平台和服务等级而异。

推理加速平台Fast Inference Platforms

GroqSambaNovaCerebras

用自研推理芯片提供 API 的平台,共同特点是响应速度快(每秒几百到几千 token)。免费层提供开源模型,适合对延迟敏感的开发和调试。三家的额度结构不同:Groq 按请求数算,SambaNova 请求少但单次可用 token 多,Cerebras 按 token 总量算。

聚合平台Aggregator Platforms

OpenRouterPuter

第三方平台,一个入口调用多家厂商的模型。OpenRouter 一个 key 调用 500+ 个模型,免费额度覆盖 20+ 个免费模型;Puter 面向浏览器应用,开发者免费接入,AI 费用记在最终用户的账号上。

本地部署Local Deployment

LM Studio

模型和算力都在你自己的电脑上,不经过任何服务器。没有账号、没有限额、数据不出本机,代价是硬件配置——能跑多强的模型,取决于你的显卡和内存。

DIM 2

分类维度二:按免费形态

By Form of Free

把市场上所有「免费」摊开看,共有五种形态。分清它们,你才知道哪家能长期用、哪家只是一次性额度。

限速型

Rate-Limited · 能久用

按请求频率或 token 设限,通常没有固定试用到期日;平台可调整免费模型与限额。

代表:Gemini、Groq、SambaNova、Cerebras、OpenRouter 免费池、智谱

储值型

Trial Credit · 一次性

送一笔一次性额度,按 token 扣费,用完即停。适合短期集中试用,不适合长期挂服务。

代表:阿里百炼 90 天额度

池化型

Rotating Pool · 模型不定

额度永久,但免费的是「一池轮换的模型」,具体是哪几个模型随时会变。你能长期免费,但别把项目绑死在某个具体模型上。

代表:OpenRouter 的 :free 模型池

用户分摊型

User-Pays · 开发者零成本

对开发者免费,没有开发者侧的账单;AI 费用记在最终用户的账号上,新账号通常送起始额度。适合做面向终端用户的网页应用。

代表:Puter

本地部署

Local · 没有限额

不算 API:模型跑在自己电脑上,不限次数、不限 token、离线可用。没有「额度」这个概念,代价是硬件。

代表:LM Studio

免费之外的代价

读免费条款时,真正要读的是代价。你付出的不是钱,而是:

  • 训练数据。Gemini 免费层和部分 OpenRouter 上游模型可能将输入输出用于产品改进或训练;两家的具体条款及隐私设置不同,敏感数据不要直接传入。
  • 身份信息。智谱需要手机号注册;Puter 需要你的用户登录账号。
  • 硬件成本。本地部署(LM Studio)不花 API 钱,但需要自己的显卡和内存。
  • 限速和后续付费。免费额度在设计上满足学习开发、不够支撑生产流量,项目做大了需要付费。
DIM 3

分类维度三:按地域与网络接入

By Region & Accessibility

对中文读者来说,这个维度比前两个更实际:能不能直连,直接决定一家平台对你值不值。

国际平台6 家

  • Groq一般可直连——国际平台里对大陆网络最友好
  • OpenRouter一般可直连——免费模型池同样可用
  • SambaNova需实测——大陆直连情况以实测为准
  • Cerebras需实测——大陆直连情况以实测为准
  • Puter需实测——网页应用,大陆访问情况以实测为准
  • Google Gemini无法直连——需要特殊网络环境,大陆读者门槛最高

中国平台2 家

  • 智谱 BigModel中国境内直连——手机号注册即用,零网络成本
  • 阿里百炼中国境内直连——需阿里云账号 + 实名认证

本地部署1 家

  • LM Studio离线运行——不需要网络;下载模型时可走 Hugging Face 镜像站加速

注:以上可达性为 2026 年 9 月社区普遍反馈,网络环境因人而异,以实测为准。

DIM 4

分类维度四:按接口兼容性

By API Compatibility

多数云端平台提供 OpenAI 兼容接口,可复用部分 openai 库代码,但端点与功能仍需逐项验证。Puter 主要通过 Puter.js 调用,不能只改 base_url 接入;LM Studio 可以在本机启动 OpenAI 与 Anthropic 兼容的 API 服务。

02

逐家详解:是什么、优缺点、怎么用、适合谁

The Platforms, One by One

六家国际平台、一家本地部署工具、两家中国平台。每张卡片按同一套模板拆解:它是什么 → 属于哪一类 → 免费额度 → 优缺点 → 如何使用 → 推荐人群与理由。

Google GeminiGoogle AI Studio

官方开发者平台 · 限速型

是什么:Google 自家多模态大模型 Gemini 的官方 API 入口,通过 AI Studio 提供。免费层注册即用、无需信用卡,是免费 AI API 里能力最均衡的日常主力——文本、图片、代码一次搞定。

免费额度
无需信用卡,注册即用 Flash 系列限额以 AI Studio 面板为准 部分账号单模型 TPM 达百万级 限额以控制台实时显示为准
优缺点

优点

  • 免费层能力最均衡:文本、图像、代码全覆盖,多模态是免费池最强
  • 门槛最低:无需绑卡、无需手机验证,注册即用
  • 额度相对宽裕,部分账号 TPM 达百万级,Flash 系列适合跑量
  • SDK 生态成熟,升级付费路径顺滑

缺点

  • 大陆无法直连,是九家里网络门槛最高的一家
  • 限额不透明:官方自 2026-09 起不再公布静态限额表,媒体数字互相打架
  • 免费层数据可能被用于训练(EEA / 瑞士 / 英国除外),敏感数据不能传
  • Pro 系列已基本退出免费层;开启付费会替换该项目的免费层
如何使用
  1. 打开 ai.google.dev,用 Google 账号登录 AI Studio
  2. 在「Get API key」里生成 key——无需绑卡,全程一分钟
  3. 用 OpenAI 兼容地址 https://generativelanguage.googleapis.com/v1beta/openai/ 接入,或直接用 Google 原生 SDK
  4. 调用前先到 AI Studio 的限速面板确认你账号的实时限额
注册入口ai.google.dev 接口地址generativelanguage.googleapis.com/v1beta/openai/ 示例模型gemini-2.5-flash
推荐人群与理由
  • 在校学生 / 转行者的第一个 AI 项目——无卡无验证,注册即用;一个平台就能覆盖文本、图片、代码三类需求,学习期不用换工具
  • 需要图文混合处理的独立开发者——Gemini 的视觉理解在免费池里没有对手,识图、摘要、生成都能做
  • 有稳定国际网络环境的内容 / 自动化工具开发者——额度宽裕到可以挂长期小工具,而其他家的限速型额度大多撑不住
中文用户提示:没有稳定网络环境的话,不要把它当首选——直接用后面的智谱 GLM-4-Flash 起步更实际。有环境的话,它是九家里免费层能力最强的一家。

GroqLPU Inference

推理加速平台 · 限速型

是什么:一家用自研 LPU 芯片做推理加速的公司,API 上跑的是开源权重模型(OpenAI 的 gpt-oss 系列、Qwen 变体等),免费层以速度快著称——每秒几百 token,做聊天、语音交互这类对延迟敏感的应用,体验最接近付费。

免费额度(组织级,无卡)
30 次/分钟 1,000 次/天 8,000 token/分钟 200,000 token/天 模型:gpt-oss-120b / gpt-oss-20b / qwen3.6-27b
优缺点

优点

  • 免费层里最快:LPU 推理,每秒几百 token,交互体验接近付费产品
  • OpenAI 完全兼容:现有 openai 库代码只改 base_url 和 key 就能跑
  • 20 万 token/天在限速型免费层里算慷慨,够撑一个开发期项目
  • 无需信用卡,邮箱注册即用

缺点

  • 模型少且轮换快:Llama 系列 2026-08 已下线,老教程代码会直接报错
  • 只跑开源权重模型,没有 Gemini 级别的闭源旗舰
  • token 也有日上限(20 万/天),长提示 + 大上下文烧得比想象快
  • 免费层高峰期可能排队,稳定性不如付费
如何使用
  1. 打开 console.groq.com,邮箱注册(无需绑卡)
  2. 在「API Keys」页生成 key;顺路看一眼「Limits」页——你账号的实时限额在那里
  3. 把现有 OpenAI 代码的 base_url 改成 https://api.groq.com/openai/v1,模型名换成 openai/gpt-oss-120b
  4. 注意:网上流传的「14,400 次/天」已过时,按 1,000 次/天规划用量
注册入口console.groq.com 接口地址api.groq.com/openai/v1 示例模型openai/gpt-oss-120b
推荐人群与理由
  • 独立开发者做 MVP——1,000 次/天够开发期用,速度又快,调试体验和付费没区别
  • 做实时聊天 / 语音交互的人——低延迟是交互类应用的命门,Groq 免费层的响应速度在同类里最快
  • 已有 OpenAI 格式代码、想零成本跑起来的人——迁移成本最低的一家,改两行配置就能免费使用
中文用户提示:中国境内一般可直连(以实测为准),是国际平台里对大陆网络最友好的一家,也是「零成本迁移」最划算的入口。

SambaNovaSambaNova Cloud

推理加速平台 · 限速型

是什么:用自研 RDU 芯片做推理的平台(SambaNova Cloud),速度接近 Groq 一档,但免费层的模型档次更高:官方当前免费名单包括 Llama 3.3 70B、DeepSeek-V3.1 和 gpt-oss-120b。具体模型以官方限额页为准。

免费额度(无卡,按模型分别计算)
Llama 3.3 70B:20 次/分钟 · 20 次/天 · 20 万 token/天 DeepSeek-V3.1、gpt-oss-120b:限额以官方模型表为准 DeepSeek-V3.1、gpt-oss-120b 同样免费 其他新用户活动以控制台为准
优缺点

优点

  • 免费层提供多种开源模型,适合做兼容性和速度测试
  • RDU 芯片推理,速度快
  • 20 万 token/天按模型分别计算——平均每次请求可用约 1 万 token,适合长任务
  • 无需信用卡,OpenAI 兼容,响应头里直接返回限速状态

缺点

  • 日请求数只有 20 次:适合「少量大任务」,不适合频繁对话
  • 免费模型名单可能变化,选型前要重新核对
  • 20 次/天的额度不适合频繁对话
如何使用
  1. 打开 cloud.sambanova.ai 注册(无需绑卡)
  2. 在控制台生成 API key
  3. 接口地址 https://api.sambanova.ai/v1,OpenAI 兼容
  4. 模型名用 Meta-Llama-3.3-70B-Instruct;调用后看响应头的限速字段掌握余量
注册入口cloud.sambanova.ai 接口地址api.sambanova.ai/v1 示例模型Meta-Llama-3.3-70B-Instruct
推荐人群与理由
  • 想试用开源模型的人——可用低频额度比较 Llama、DeepSeek 和 gpt-oss 的输出
  • 长文档分析等低频大任务——20 次/天每次可用约 1 万 token,正好匹配「量少但单次重」的工作方式
  • 给 Groq 找一个互补的备用——同为加速平台,模型阵容和额度结构不同,可以互相补位
中文用户提示:大陆直连情况以实测为准。注册不需要信用卡,适合当作低频任务专用通道。

CerebrasCerebras Inference

推理加速平台 · 限速型

是什么:用晶圆级芯片(wafer-scale)做推理的公司,速度在免费层里是第一档——每秒数千 token,长文输出几乎瞬间完成。免费额度按 token 总量给:约 100 万 token/天,是九家里给得最多的。

免费额度
约 1,000,000 token/天 免费试用等级,当前额度以控制台为准 gpt-oss-120b 免费试用:5 次/分钟;其他模型见控制台 官方当前示例:gpt-oss-120b、qwen-3.8-27b
优缺点

优点

  • 速度第一档:晶圆级芯片,每秒数千 token,长文本输出最快
  • 100 万 token/天是九家里最高的 token 额度,批量文本处理管够
  • 131K 上下文,适合长文档
  • 无需信用卡,OpenAI 兼容

缺点

  • 限额按模型与账号等级变化,应以控制台为准
  • 免费模型阵容变动快,旧教程中的模型可能已不可用
  • token 不结转,用不完的部分次日清零
如何使用
  1. 打开 cloud.cerebras.ai 注册(无需绑卡)
  2. 在控制台生成 API key
  3. 接口地址 https://api.cerebras.ai/v1,OpenAI 兼容
  4. 选模型前先看官方当前免费名单——阵容几个月就会变一次
注册入口cloud.cerebras.ai 接口地址api.cerebras.ai/v1 示例模型gpt-oss-120b / qwen-3.8-27b
推荐人群与理由
  • 长文档处理、批量文本任务的人——100 万 token/天的总量能跑真正的批处理,其他家的免费层撑不起这个量
  • 对响应速度敏感的体验向应用——每秒数千 token 的输出速度,长回复几乎不用等
中文用户提示:大陆直连情况以实测为准。用它之前先查官方免费模型名单,别照着老教程写 Llama 模型名。

OpenRouterModel Gateway

聚合平台 · 限速型 + 池化型

是什么:一个聚合 500+ 模型的统一网关,一次注册、一个 key 就能调用几乎所有主流模型的 API,其中 20+ 个免费模型(模型 ID 带 :free 后缀)轮换上架——免费池里有 Llama 3.3 70B、Qwen3 Coder、GPT-OSS、Nemotron 等。它解决的不是「免费用」,是「不确定用哪个」。

免费额度
20 次/分钟 50 次/天 充值后的免费模型日限额请查看官方定价与账号面板 免费模型 $0/token,限制在请求次数 免费路由器 openrouter/free 自动挑可用模型
优缺点

优点

  • 一个 key 通吃 500+ 模型,横向对比的成本趋近于零
  • 一个账号可比较多种免费模型,充值政策应以官方页面为准
  • 免费路由器 openrouter/free 自动容错,A 模型挂了自动切 B
  • 防锁定:换模型只改一个参数,不依赖任何一家厂商

缺点

  • 免费模型的上游数据政策可能不同;OpenRouter 的内容日志设置需单独核对
  • 失败请求也计入每日额度,重试循环会烧光 50 次/天
  • 免费端点上下文窗口可能比付费版小;高峰期上游限流
  • 官方自己都说免费模型不适合生产
如何使用
  1. 打开 openrouter.ai,用 Google 或 GitHub 账号登录
  2. 在「Keys」页生成 API key
  3. 接口地址 https://openrouter.ai/api/v1,模型名加 :free 后缀即走免费额度
  4. 在账号面板确认当前免费请求额度与隐私设置
注册入口openrouter.ai 接口地址openrouter.ai/api/v1 示例模型qwen/qwen3-coder:free
推荐人群与理由
  • 付费前想横向对比模型的人——同一段提示词发给 20+ 个免费模型,跑一轮就知道谁适合你的任务,省下盲目订阅的钱
  • 做模型评测 / 选型的团队——统一接口 + 统一计量,评测脚本写一次能复用所有模型
  • 不想被任何一家厂商锁定的开发者——代码只依赖 OpenRouter 一个中间层,供应商随便换
中文用户提示:中国境内的可达性以实测为准;免费模型与充值政策可能变化,使用前查看官方定价和账号面板。

PuterPuter.js · Internet OS

聚合平台 · 用户分摊型

是什么:一个开源的「互联网操作系统」(puter.com),附带的 Puter.js 让网页应用几行代码接入 AI——覆盖 400+ 模型、70+ 供应商(OpenAI、Anthropic、Gemini、Qwen、Nemotron 及图像、视频、语音模型)。它的免费逻辑和别家不同:开发者零成本接入,AI 费用记在最终用户自己的 Puter 账号上。

免费额度
开发者侧:免费接入,无账单 用户侧:新账号送起始额度 账号用量限制以官方账户面板为准 400+ 模型,也可走 OpenRouter 的 :free 池
优缺点

优点

  • 零后端、零 key:前端几行代码接入,开发者不用管账单
  • 模型覆盖 400+,是本文最全的
  • 用户分摊模式天然适合「AI 功能免费给用户用」的产品
  • 开源,可以自托管

缺点

  • 用户侧费用和用量限制需要在各自账户里确认
  • Node.js 使用需要额外的身份验证流程,不能按普通 OpenAI API 配置
  • 不是完整 API 面:没有 Responses API、结构化输出等能力
  • 每个终端用户都要注册 Puter 账号,门槛转嫁给了用户
如何使用
  1. 打开 puter.com 阅读开发者文档,在网页里引入 Puter.js
  2. 调用 puter.ai.chat(),指定模型名即可发起对话
  3. 你的用户登录自己的 Puter 账号使用——AI 费用从他们的账号扣
  4. Node.js 场景请按照官方文档配置 Puter 身份验证
注册入口puter.com 接入方式前端引入 Puter.js 调用方法puter.ai.chat()
推荐人群与理由
  • 做网页应用 / Demo 的前端开发者——不用搭后端、不用管 key 和账单,用户的 AI 用量用户自己付
  • 想在一个入口接入所有模型的团队——400+ 模型覆盖最全,换模型改一行代码
中文用户提示:大陆访问情况以实测为准;面向中国用户的产品,要先确认用户注册 Puter 账号的流程是否顺畅,再决定是否采用这种分摊模式。

LM StudioLocal LLM Desktop

本地部署 · 无限额

是什么:本地桌面应用(Mac / Windows / Linux),从模型库下载开源模型(Llama、Qwen、DeepSeek 等)在你自己的电脑上运行,内置 OpenAI 兼容服务器 http://localhost:1234/v1。它不是 API 平台——模型和算力都是你自己的,因此没有限额、没有账号、数据不出本机。

免费额度
无任何限额:不限次数、不限 token、离线可用 实际能力取决于本地硬件(内存 / 显卡) 软件免费开源,模型免费下载
优缺点

优点

  • 完全免费无限额,自动化测试、Agent 调试随便跑
  • 数据不出本机,隐私最好,内网环境也能用
  • 离线可用,不依赖任何服务
  • 兼容面最广:OpenAI 格式、Responses、Anthropic Messages 都支持,Claude Code 等工具可直接接本地模型

缺点

  • 需要自己的硬件:推荐 16GB 内存起步,跑大模型要有 GPU 或大显存
  • 本地推理速度取决于硬件,一般比云端慢
  • 模型能力受限于你能跑动的开源模型(可用量化版压缩体积)
如何使用
  1. 打开 lmstudio.ai 下载安装(Mac / Windows / Linux)
  2. 在应用内搜索并下载模型(GGUF 格式,可选 Q4 等量化版)
  3. 在 Developer 页开启本地服务器,默认 http://localhost:1234/v1
  4. 代码里 base_url 填本地地址,key 随便填,模型名填已加载的模型
下载入口lmstudio.ai 接口地址localhost:1234/v1 模型格式GGUF(含量化版)
推荐人群与理由
  • 数据敏感 / 内网环境的开发者——数据不出本机是硬需求时,本地部署是唯一选择
  • 想无限量跑量的人(自动化测试、Agent 调试)——没有限额概念,跑多少遍都不花钱
  • 经常没有网络环境的场景——离线可用,飞机上、机房断网都能干活
中文用户提示:运行不需要网络;下载模型时可走 Hugging Face 镜像站加速。想用 Claude Code 等工具接本地模型,把 ANTHROPIC_BASE_URL 指到 http://localhost:1234 即可。

智谱 BigModelGLM

官方平台(中国)· 免费模型与试用额度

是什么:智谱的 GLM 系列模型 API 平台,适合中国境内开发者试用。免费模型名单、并发限制及新用户赠额可能变化,请在官方定价页和账户面板核对。若之后考虑付费网关,应逐项比较实际模型价格、接口能力与账单。

免费额度
GLM 免费模型:以当前定价页为准 其他 Flash 模型是否免费,以账户面板为准 并发与频率限制以当前账户面板为准 新用户另有赠送 token(数量与有效期以官方条款为准)
优缺点

优点

  • 可先从官方当前免费模型开始试用
  • 零门槛:手机号注册即用,无卡、无网络环境要求
  • 提供 OpenAI 兼容调用方式;上下文长度依具体模型而定
  • 中国境内直连,延迟与稳定性对大陆用户最优

缺点

  • 免费的是 Flash 级模型,能力上限低于国际免费池里的旗舰开源模型
  • 「注册赠送千万级 token」的宣传口径在各来源间有出入(500 万 / 2,000 万 / 按月消耗说),别按赠额规划长期项目
  • 并发限制的口径也不统一,跑量前先在控制台确认
如何使用
  1. 打开 open.bigmodel.cn,手机号注册
  2. 在控制台生成 API key,赠送额度自动到账
  3. OpenAI 兼容地址 https://open.bigmodel.cn/api/paas/v4/,模型名 glm-4-flash
注册入口open.bigmodel.cn 接口地址open.bigmodel.cn/api/paas/v4/ 示例模型glm-4-flash
推荐人群与理由
  • 中国学习者、学生的第一个 API——零门槛零成本,不用解决网络问题,注册到跑通第一个请求十分钟
  • Agent 工作流、代码辅助的原型测试——先用官方当前免费模型验证流程,再检查模型能力与并发限制
  • 不想折腾网络环境的中国开发者——直连稳定,是国际平台之外最省心的替代
提示:Flash 能力有限——需要更强模型时,用它跑通流程,再用百炼的新用户额度测 Qwen / DeepSeek 等旗舰。

阿里百炼Model Studio

官方平台(中国)· 储值型(试用金)

是什么:阿里云的大模型服务平台,可试用 Qwen 和部分第三方模型。合资格新用户通常按模型分别获得免费 token 额度,90 天内有效,实际模型与额度以控制台为准。额度到期或耗尽后,已认证账户可能转为按量付费;不想付费时应启用「免费额度用完即停」。

免费额度
合资格模型通常各有 100 万 token 总额度取决于当前合资格模型名单 有效期 90 天,过期不补 仅华北 2(北京)地域、仅抵扣实时推理
优缺点

优点

  • 覆盖多种模型,适合在有效期内做横向比较
  • 各模型额度独立,适合分别做小规模验证
  • 中国境内直连、阿里云生态成熟,企业后续付费迁移顺滑

缺点

  • 90 天过期是硬约束:适合「集中试用 + 短期项目」,不适合长期使用
  • 需要阿里云账号;是否认证会影响额度用尽后的计费行为
  • 不同模型额度互不相通;同一实名主体重复注册无法再领
  • 额度耗尽后默认自动转按量付费——务必开启「免费额度用完即停」
如何使用
  1. 注册阿里云账号,先确认免费额度与认证状态
  2. 打开 bailian.console.aliyun.com 开通百炼模型服务——免费额度自动发放,无需手动领取
  3. 在「模型广场」查看各模型的剩余额度与到期时间,创建 API-KEY
  4. 用 OpenAI 兼容地址 https://dashscope.aliyuncs.com/compatible-mode/v1 接入
  5. 在设置里开启「免费额度用完即停」,防止自动扣费
注册入口bailian.console.aliyun.com 接口地址dashscope.aliyuncs.com/compatible-mode/v1 示例模型qwen-max / deepseek-v3
推荐人群与理由
  • 想一次试遍中国主流模型的人——Qwen、DeepSeek、Kimi、GLM 每模型 100 万 token,90 天内完成选型毫无压力
  • 有明确 90 天内要做的项目 / 比赛的团队——试用金型额度的正确用法:集中火力短期消耗,而不是细水长流
  • 需要 DeepSeek / Kimi 等第三方模型 API 的开发者——在百炼一个平台就能拿到多家模型的中国境内稳定接入
提示:它是「储值型」免费的代表——用它的方式是一次性横向评测,而不是日常主力。长期使用前核对智谱和 Groq 的当前免费模型与限额。
03

人群速查表

Who Should Pick What

别按功能挑,按「你是谁」挑。对号入座:

你是谁首选备选理由
在校学生 / 学习者 智谱 GLM-4-Flash 百炼新用户额度 中国境内接入方便;免费模型与额度请核对控制台
独立开发者做 MVP Groq SambaNova 快 + OpenAI 兼容,现有代码零改动;1,000 次/天够开发期用
免费额度用尽、想低价续用 A2Agent OpenRouter($10 解锁) 可作为其他平台免费额度用尽后的付费备选;模型价格和兼容性以官网及账号配置为准
模型选型 / 评测团队 OpenRouter($10 解锁) Puter 一个 key 横向对比多个免费模型;充值后的额度以官方定价和账号面板为准
长文档 / 批量文本处理 Cerebras SambaNova 约 100 万 token/天,长文本跑量管够;SambaNova 每次请求可用约 1 万 token
网页应用,想让用户分摊 AI 成本 Puter OpenRouter 前端接入、开发者无账单,AI 费用由用户自己的账号承担
想比较不同开源模型 SambaNova Cerebras SambaNova 可低频测试 Llama、DeepSeek 和 gpt-oss,模型名单需实时确认
数据敏感 / 离线 / 内网环境 LM Studio — 数据不出本机、无限额、离线可用;代价是自己的硬件
想一次性试遍中国模型 阿里百炼 智谱 70+ 模型每模型 100 万 token,90 天内横向评测完再决定付费谁
04

免费额度生存手册

Living Within Free Limits

免费层的限额数字都很小,用对这六招,50 次/天的额度也能撑起一个学习项目。

TIP 01

缓存重复答案

同一个问题问十次 = 烧十次额度。把常见问答存到本地,先查缓存再调 API。这是省额度收益最高的一招。

TIP 02

提示词减肥

限额不只算请求次数,也算 token(Groq 每天 20 万 token、Cerebras 约 100 万 token)。长上下文 + 长提示会悄悄烧光额度,裁剪到模型真正需要的内容。

TIP 03

批量合并

每分钟的请求数上限很低(Groq 30、SambaNova 20)。把多个小任务合成一次调用,省的是最稀缺的 RPM。

TIP 04

大小模型分工

简单活交给 Flash / 小模型,难题再上大的。免费池里的小模型往往限额相同但 token 消耗更低,等于变相扩容。

TIP 05

额度互备

对支持 OpenAI 兼容接口的平台,可以复用客户端并切换 base_url、密钥与模型名;Puter 等平台需要各自的 SDK 或鉴权方式。做额度互备前先测试实际接口。

TIP 06

盯着面板

失败请求也算额度(OpenRouter 明确如此)。上线前先在各家面板看一眼用量,别让一个重试循环把一天的额度烧光。

免费是入口,不是终点

这九家中,限速型免费层适合学习和小工具;Puter 是用户承担费用,本地部署 LM Studio 则需要自己的硬件。尽量使用可迁移的接口设计,等流量起来后再比较付费方案;迁移时仍需核对模型能力、鉴权与计费。先免费起步,等产品值得付费时再付费。

References· 参考来源

  1. A2Agent — 官网(Detailed pricing comparison)
  2. Groq Free Tier 2026: 1,000 Requests a Day, Llama Is Gone — Klymentiev Blog(Groq 免费层限额)
  3. Groq's 14,400 requests a day is not for the chat models — DEV Community(「14,400 次/天」旧数字的澄清)
  4. Rate Limits Policy — SambaNova 官方文档(SambaNova 免费层限速)
  5. Cerebras Rate Limits — Cerebras 官方文档(免费试用模型与限额)
  6. Free, Unlimited AI API — Puter 开发者文档(Puter 免费接入方式)
  7. Use your LM Studio Models in Claude Code — LM Studio 官方博客(LM Studio 本地服务器与接口兼容性)
  8. OpenRouter Pricing — OpenRouter 官方页面(免费模型与请求限额)
  9. 谷歌开始提高免费 Gemini API 配额,部分模型已达每分钟 100 万 Token — 小众软件(Gemini 免费配额变动)
  10. Free LLM API Tiers: Limits by Provider, Verified — BenchLM(各家免费层限额交叉核对)
  11. 百炼新人免费额度规则 — 阿里云官方文档(额度与有效期)

OFFICIAL SITES · 平台官网入口