← 返回全部文章

英伟达免费开放 GLM-5.2,这次开发者可以直接白嫖

NVIDIA Build 上线 Z.ai 的 GLM-5.2,页面显示 Free Endpoint 可用,还支持 Partner Endpoint 和下载。它是一个面向 Agent、代码和长程推理的旗舰模型,1M 上下文、753B MoE,适合先拿来做 API 体验和工程测试。

英伟达这次确实有点“大善人”。

NVIDIA Build 上已经上线 Z.ai 的 GLM-5.2,页面里的 Model Availability 明确写着**:Free Endpoint:Available**。同一页还显示 Partner Endpoint 可用,Download Available 也可用。

这意味着开发者现在可以在 NVIDIA 的接口平台上直接试 GLM-5.2,不用先自己折腾部署,不用先找机器拉模型,先拿 API 跑起来再说。

入口在这里:

https://build.nvidia.com/z-ai/glm-5.2

这次开放的是什么

GLM-5.2 是 Z.ai 的最新旗舰大模型,NVIDIA 页面给它的定位很明确:面向 Agent 工作流、代码、长程推理和工具调用。

几个关键信息:

  • 模型:z-ai/glm-5.2
  • 提供方:Z.ai
  • NVIDIA Build 发布时间:2026 年 7 月 2 日
  • Hugging Face 发布时间:2026 年 6 月 16 日
  • 参数规模:753B
  • 架构:MoE,GLM + DSA + IndexShare sparse attention
  • 上下文:1,000,000 tokens
  • 默认最大输出:16,384 tokens,页面参数上限显示 32,768
  • 输入输出:文本
  • 支持:多轮对话、 system prompt 、 tool calling 、 streaming 、 structured output 、 reasoning traces 、 tool call responses

NVIDIA 的模型卡还写到,GLM-5.2 可以用于复杂软件工程、 Agent 工作流、数学推理、代码调试、终端自动化和长上下文多轮对话。

免费 Endpoint 的价值

很多大模型新闻看起来热闹,真正动手时会卡在第一步:没有可用接口,没有额度,没有部署环境。

GLM-5.2 这次放到 NVIDIA Build,最实用的点就是 Free Endpoint 。开发者可以先生成 NVIDIA API Key,再通过 OpenAI 兼容接口调用。

官方页面给出的 Python 调用方式是 OpenAI SDK 风格,核心是这几行:

from openai import OpenAI

client = OpenAI(
    base_url="https://integrate.api.nvidia.com/v1",
    api_key="$NVIDIA_API_KEY"
)

completion = client.chat.completions.create(
    model="z-ai/glm-5.2",
    messages=[{"role": "user", "content": "写一个 FastAPI 健康检查接口"}],
    temperature=1,
    top_p=1,
    max_tokens=16384,
    stream=True
)

for chunk in completion:
    delta = chunk.choices[0].delta
    if getattr(delta, "content", None):
        print(delta.content, end="")

这套接口对开发者很友好。以前接过 OpenAI 兼容接口的人,改 base_url 、 model 和 key 就能试。

适合先测哪些场景

我建议别只拿它问闲聊问题。 GLM-5.2 的卖点不在闲聊,而在长上下文、代码和 Agent 。

可以先测这些任务:

  • 丢一大段项目文档,让它做架构梳理
  • 给一个报错日志和相关代码,让它定位问题
  • 让它拆解一个多步骤开发任务
  • 测试 tool calling 和结构化输出
  • 给它一段长需求,让它生成实现计划
  • 用终端自动化任务测试它的连续推理稳定性

1M 上下文的价值在长任务里。代码库理解、长文档分析、复杂工作流规划,都属于它更该上场的地方。

自己部署也有路

NVIDIA 页面除了 Free Endpoint,还写了 Download Available,并给了 NIM 容器路径。

页面里的自托管命令大概是这样的:

docker login nvcr.io

export NGC_API_KEY=<你的 API Key>
export LOCAL_NIM_CACHE=~/.cache/nim
mkdir -p "$LOCAL_NIM_CACHE"
chmod -R a+w "$LOCAL_NIM_CACHE"

docker run -it --rm \
  --gpus all \
  --shm-size=16GB \
  -e NGC_API_KEY \
  -v "$LOCAL_NIM_CACHE:/opt/nim/.cache" \
  -p 8000:8000 \
  nvcr.io/nim/zai-org/glm-5.2:latest

不过自托管这条路对普通开发者不算轻。模型卡写到测试硬件包括 NVIDIA Grace Blackwell GB200x4 和 GB300x4,支持硬件也指向 Blackwell 、 Hopper,操作系统是 Linux 。

所以更现实的路径是:先用 Free Endpoint 测任务质量,确认值得投入,再考虑 Partner Endpoint 或自托管。

别忽略使用条款

NVIDIA 页面也写得很清楚:这个模型来自第三方 Z.ai,并非 NVIDIA 自研。试用服务受 NVIDIA API Trial Terms 约束,模型使用还涉及 NVIDIA Open Model Agreement,页面同时标注了 MIT License 相关信息。

它可以用于商业或非商业场景,但上线到真实产品前,还是要按自己的业务场景做安全、质量和合规测试。

这点尤其适合 Agent 类应用。能调用工具、能跑长任务,能力越强,越要做边界测试。

我的判断

这次最值得关注的点很具体:NVIDIA 把一个 1M 上下文、面向 Agent 和代码的国产模型放到了可直接调用的位置。

对开发者来说,这就是一个免费试车场。先拿自己的代码、文档和工作流跑一圈,看看它在长上下文和工程任务上到底能不能扛住。

如果你手上正好有 Agent 、代码审查、长文档分析、自动化执行这类任务,现在可以直接去 NVIDIA Build 试。

来源链接:

https://build.nvidia.com/z-ai/glm-5.2

来源:https://build.nvidia.com/z-ai/glm-5.2