硅基流动 SiliconFlow 免费额度
永久免费免费档没有取消,反而比多数人以为的多:2026-09-13 实测 9 个免费模型全部可调用,其中 Qwen/Qwen3.5-4B 上下文 256K 且支持工具调用。真正的坑是「同名模型有 Pro/ 付费前缀版」,选错即计费。
🌏 国内直连对话RAG语音图像🕐 最后核实 2026-09-13
1免费额度 & 限速(重点)
📦 额度官方定价页标价 ¥0 的模型免费调用,需先完成实名认证。注意:同名 Pro/ 前缀版本为收费(如 Pro/Qwen/Qwen2.5-7B-Instruct ¥0.35/M Tokens),粘贴模型名时务必核对前缀。
⚡ 限速官方按账户等级(L0–L5)公示限速,L0 档 RPM 1,000 / TPM 50,000(限速口径核实于 2026-09-05)。实际瓶颈通常是 TPM 而非 RPM:一次问答约 500–1500 token,50,000 TPM 约合每分钟 30–100 次问答。
🧠 能力模型市场聚合 DeepSeek / Qwen / GLM / Kimi / MiniMax 等,当日在线 94 个模型(GET /v1/models 实测);OpenAI 兼容。免费档以官方定价页与登录后模型广场为准。
🔁 节奏长期有效 —— 不用盯重置,但官方随时可能收紧
🎁 免费模型清单(10)- Qwen/Qwen3.5-4B(256K 上下文;工具调用;实测 0.50s)—— 综合最优选
- Qwen/Qwen3-8B(128K;工具调用;实测 39.3s,首包慢,适合后台任务)
- THUDM/GLM-Z1-9B-0414(128K;工具调用;推理型,实测 3.0s)
- THUDM/GLM-4-9B-0414(32K;工具调用;实测 0.33s)
- deepseek-ai/DeepSeek-R1-0528-Qwen3-8B(128K;推理型,实测 8.2s)
- Qwen/Qwen2.5-7B-Instruct(32K;工具调用;实测 0.37s)
- tencent/Hunyuan-MT-7B(32K;翻译专用;实测 0.30s)
- deepseek-ai/DeepSeek-OCR(8K;文档识别;实测 0.28s)
- PaddlePaddle/PaddleOCR-VL-1.5(OCR / 视觉;实测 0.32s)
- 另有免费的非对话模型:向量 BAAI/bge-m3、bge-large-zh/en-v1.5;重排 bge-reranker-v2-m3、Qwen3-Reranker-0.6B/4B/8B;语音识别 SenseVoiceSmall、Qwen3-ASR-1.7B;生图 Kwai-Kolors/Kolors
2够用吗?一句话判读
免费档没有取消:2026-09-13 实测 7 个通用对话模型 + 2 个 OCR 模型免费且全部返回 200,其中 Qwen3.5-4B 的 256K 上下文在同价位里少见。要防两个坑——同名 Pro/ 付费版,以及「能调通不等于免费」。
3不写代码,怎么把它的免费用起来
这一家提供的是 OpenAI 兼容接口——意思是它可以被直接填进现成的聊天工具,不需要你写任何一行代码。选一个你在用的工具,照着下面三步填就行。
4开发者视角:路径、代码、命令行验证默认折叠 —— 如果你不写代码,上面那一节就够了。这里给的是官方 SDK 用法与命令行自检。
🔑 路径siliconflow.cn → 注册 → 完成实名认证 → 左侧「API 密钥」创建
最小可运行代码
from openai import OpenAI
client = OpenAI(api_key="sk-xxx", base_url="https://api.siliconflow.cn/v1")
r = client.chat.completions.create(model="Qwen/Qwen3.5-4B", messages=[{"role":"user","content":"你好"}])
print(r.choices[0].message.content)以上为最小可运行示例(OpenAI 兼容或官方 SDK)。多数客户端会自动补全 /chat/completions,接口地址不要手拼完整路径。
5避坑提醒
⚠️ 上线前必看- 同名模型有 Pro/ 付费版:Qwen/Qwen2.5-7B-Instruct 免费,而 Pro/Qwen/Qwen2.5-7B-Instruct 是 ¥0.35/M Tokens,多抄一个前缀就计费
- 「能调通」不能证明「免费」:实测收费模型(DeepSeek-V4-Pro / GLM-5.3 / Kimi-K2.7-Code)在账号有赠送额度时同样返回 200,免费只能看官方定价
- 已停用模型会返回 403 Model disabled(如 THUDM/glm-4-9b-chat、Qwen/Qwen2-7B-Instruct),别照搬旧教程里的模型名
- 免费不等于不限速,L0 档 TPM 50,000 是硬上限,多实例共用同一 Key 容易撞 429
- 模型上下架与价格变动频繁,发布前应重新核对官方定价页
🔍 数据时效说明 免费额度、限速随时会变(本页核实于 2026-09-13)。上线 / 量产前请以官方页面为准。
📄 核实出处 2026-09-13 实测:GET /v1/models 返回 94 个在线模型;对官方定价页标价 ¥0 的 9 个模型逐个 POST /v1/chat/completions,全部 200(Qwen3.5-4B 256K/0.50s、GLM-4-9B-0414 0.33s、Hunyuan-MT-7B 0.30s、Qwen2.5-7B-Instruct 0.37s、GLM-Z1-9B-0414 3.0s、DeepSeek-R1-0528-Qwen3-8B 8.2s、Qwen3-8B 39.3s)。对照组:收费模型 DeepSeek-V4-Pro / GLM-5.3 / Kimi-K2.7-Code 在账号有赠额时同样 200 —— 故免费判据只能是官方定价,不能是「调通」。 ·
官方页面 6这一页最该记的一条:「调通」不等于「免费」
官方定价页上标价「免费 / ¥0」的对话模型有 9 个。我没有直接采信标价,做了两组对照:
第一组对这 9 个模型逐个 POST /v1/chat/completions,9 个全部返回 200。最快 0.28 秒,最慢 39.3 秒(慢的那个是长上下文模型的首包,不是故障)。
第二组顺手调了 3 个明码收费的模型——DeepSeek-V4-Pro、GLM-5.3、Kimi-K2.7-Code——它们也全部返回 200。
第二组才是重点
账号里躺着官方赠送的额度时,收费模型照样回 200。所以「我调了一下能用」根本证明不了它免费——判断免费的唯一依据是官方定价页的标价。很多人在这一步方向是反的:先调通、再当成免费,等赠额烧完账单才出现。
7唯一的「亏钱坑」:多抄一个 Pro/ 前缀就计费
这条值得单独讲,因为它的后果是直接扣钱,而且发生得很安静。
同一个模型名,加 Pro/ 前缀就变成收费版
Qwen/Qwen2.5-7B-Instruct 是免费;Pro/Qwen/Qwen2.5-7B-Instruct 是 ¥0.35 / M Tokens。定价页上两行字号一样、位置相邻,从教程里复制模型名时多带或少带一个前缀,肉眼很难发现。免费版的官方显示名通常带 (Free) 后缀,以控制台里显示的完整模型名为准。
怎么防把模型名当成配置项而不是随手粘贴的字符串——放进环境变量或配置文件,改一次全局生效;不要在每个脚本里各写一遍。
已经扣了怎么办先去掉前缀重发确认;小额误扣联系官方客服说明情况,一般可退。
8这几个免费模型,你该用哪个?
要长上下文选 Qwen/Qwen3.5-4B——256K,把整本手册、整个代码仓库塞进去都行,而且实测 0.5 秒就回。这是这批免费模型里最"超纲"的一个。
要接 Agent必须支持工具调用。配好之后先发一条真的带工具调用的请求,别只看能不能聊天——「能聊天」和「能调工具」是两回事。
要推理选带 R1 / Z1 字样的那两个推理模型(128K)。慢是正常的——推理模型要先"想"一遍再答,实测 3–8 秒,拿它当实时对话会显得迟钝。
要快日常问答、批量改写这类不需要长链推理的活,挑实测 0.3 秒档的那三个。
要 OCR有两个免费的 OCR / 视觉模型,票据、扫描件、PDF 转文本可以走这两条。
⚠️ 有一个 128K 的模型这次实测花了 39 秒才回——长上下文 + 无缓存命中时首包会很慢,适合后台任务、不适合交互式界面。想要"又长又快",直接用 Qwen3.5-4B。
9报错对照表
| 现象 | 大概率原因 | 怎么办 |
| 403 Model disabled | 用的是已停用模型(旧教程里常见的那些) | 换成定价页上标 ¥0 的在售模型 |
| 401 / invalid token | Key 复制不全,或粘进了空格 | 重新复制整串,注意别把换行带进去 |
| 404 / model not found | 模型名拼错,或漏了 厂商/ 前缀 | 用 GET /v1/models 拉在线清单核对 |
| 429 / rate limit | 撞到 RPM 或 TPM 上限 | 降低并发;或把请求分散到几个免费模型上 |
| 账单出现小额扣费 | 模型名带上了 Pro/ 前缀(坑 2) | 去掉前缀重发;已有扣费联系客服说明 |