英伟达免费开放 GLM-5.2,这次开发者可以直接白嫖
NVIDIA Build 上线 Z.ai 的 GLM-5.2,页面显示 Free Endpoint 可用,还支持 Partner Endpoint 和下载。它是一个面向 Agent、代码和长程推理的旗舰模型,1M 上下文、753B MoE,适合先拿来做 API 体验和工程测试。

英伟达这次确实有点“大善人”。
NVIDIA Build 上已经上线 Z.ai 的 GLM-5.2,页面里的 Model Availability 明确写着**:Free Endpoint:Available**。同一页还显示 Partner Endpoint 可用,Download Available 也可用。
这意味着开发者现在可以在 NVIDIA 的接口平台上直接试 GLM-5.2,不用先自己折腾部署,不用先找机器拉模型,先拿 API 跑起来再说。
入口在这里:
https://build.nvidia.com/z-ai/glm-5.2
这次开放的是什么
GLM-5.2 是 Z.ai 的最新旗舰大模型,NVIDIA 页面给它的定位很明确:面向 Agent 工作流、代码、长程推理和工具调用。
几个关键信息:
- 模型:
z-ai/glm-5.2 - 提供方:Z.ai
- NVIDIA Build 发布时间:2026 年 7 月 2 日
- Hugging Face 发布时间:2026 年 6 月 16 日
- 参数规模:753B
- 架构:MoE,GLM + DSA + IndexShare sparse attention
- 上下文:1,000,000 tokens
- 默认最大输出:16,384 tokens,页面参数上限显示 32,768
- 输入输出:文本
- 支持:多轮对话、 system prompt 、 tool calling 、 streaming 、 structured output 、 reasoning traces 、 tool call responses
NVIDIA 的模型卡还写到,GLM-5.2 可以用于复杂软件工程、 Agent 工作流、数学推理、代码调试、终端自动化和长上下文多轮对话。
免费 Endpoint 的价值
很多大模型新闻看起来热闹,真正动手时会卡在第一步:没有可用接口,没有额度,没有部署环境。
GLM-5.2 这次放到 NVIDIA Build,最实用的点就是 Free Endpoint 。开发者可以先生成 NVIDIA API Key,再通过 OpenAI 兼容接口调用。
官方页面给出的 Python 调用方式是 OpenAI SDK 风格,核心是这几行:
from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="$NVIDIA_API_KEY"
)
completion = client.chat.completions.create(
model="z-ai/glm-5.2",
messages=[{"role": "user", "content": "写一个 FastAPI 健康检查接口"}],
temperature=1,
top_p=1,
max_tokens=16384,
stream=True
)
for chunk in completion:
delta = chunk.choices[0].delta
if getattr(delta, "content", None):
print(delta.content, end="")
这套接口对开发者很友好。以前接过 OpenAI 兼容接口的人,改 base_url 、 model 和 key 就能试。
适合先测哪些场景
我建议别只拿它问闲聊问题。 GLM-5.2 的卖点不在闲聊,而在长上下文、代码和 Agent 。
可以先测这些任务:
- 丢一大段项目文档,让它做架构梳理
- 给一个报错日志和相关代码,让它定位问题
- 让它拆解一个多步骤开发任务
- 测试 tool calling 和结构化输出
- 给它一段长需求,让它生成实现计划
- 用终端自动化任务测试它的连续推理稳定性
1M 上下文的价值在长任务里。代码库理解、长文档分析、复杂工作流规划,都属于它更该上场的地方。
自己部署也有路
NVIDIA 页面除了 Free Endpoint,还写了 Download Available,并给了 NIM 容器路径。
页面里的自托管命令大概是这样的:
docker login nvcr.io
export NGC_API_KEY=<你的 API Key>
export LOCAL_NIM_CACHE=~/.cache/nim
mkdir -p "$LOCAL_NIM_CACHE"
chmod -R a+w "$LOCAL_NIM_CACHE"
docker run -it --rm \
--gpus all \
--shm-size=16GB \
-e NGC_API_KEY \
-v "$LOCAL_NIM_CACHE:/opt/nim/.cache" \
-p 8000:8000 \
nvcr.io/nim/zai-org/glm-5.2:latest
不过自托管这条路对普通开发者不算轻。模型卡写到测试硬件包括 NVIDIA Grace Blackwell GB200x4 和 GB300x4,支持硬件也指向 Blackwell 、 Hopper,操作系统是 Linux 。
所以更现实的路径是:先用 Free Endpoint 测任务质量,确认值得投入,再考虑 Partner Endpoint 或自托管。
别忽略使用条款
NVIDIA 页面也写得很清楚:这个模型来自第三方 Z.ai,并非 NVIDIA 自研。试用服务受 NVIDIA API Trial Terms 约束,模型使用还涉及 NVIDIA Open Model Agreement,页面同时标注了 MIT License 相关信息。
它可以用于商业或非商业场景,但上线到真实产品前,还是要按自己的业务场景做安全、质量和合规测试。
这点尤其适合 Agent 类应用。能调用工具、能跑长任务,能力越强,越要做边界测试。
我的判断
这次最值得关注的点很具体:NVIDIA 把一个 1M 上下文、面向 Agent 和代码的国产模型放到了可直接调用的位置。
对开发者来说,这就是一个免费试车场。先拿自己的代码、文档和工作流跑一圈,看看它在长上下文和工程任务上到底能不能扛住。
如果你手上正好有 Agent 、代码审查、长文档分析、自动化执行这类任务,现在可以直接去 NVIDIA Build 试。
来源链接: