TokenRa模型广场
GLM-5.3-Flash API · 通过 TokenRa 按用量计费

GLM-5.3-Flash API - 原生多模态,100 万上下文

使用 GLM-5.3-Flash API 构建编程、持续智能体工作和复杂推理应用。按用量计费:输入 $0.14/M,输出 $0.52/M。按照下面的快速指南获取 API Key 并发送第一个请求。

$0.14 输入每 100 万输入 tokens。
$0.52 输出每 100 万输出 tokens。
100 万上下文请确认当前账号额度。

面向高效编程与长周期智能体任务

GLM-5.3-Flash 面向长周期软件工程、复杂推理和生产使用,提供 100 万 tokens 的上下文窗口,并支持文本、图像和视频输入。

01

视觉驱动的编程

输入截图、UI 设计稿或渲染结果,在 Web 和自动化工作流中生成、调试并迭代代码。

02

办公文档产出

为文档密集型工作流生成结构化交付物,具体取决于已启用的集成和输出格式。

03

计算机操作与智能体工作流

把规划、工具调用和视觉反馈结合起来,支撑持续的智能体任务和界面自动化。

适用场景

GLM-5.3-Flash 为需要持续执行和生产级评估的负载提供推理能力。

  • 长周期的软件工程与编程任务。
  • 适合结构化评估的复杂推理任务。
  • 结合规划、工具调用和应用校验的智能体工作流。
  • 需要在质量、延迟、错误率和用量上做代表性测试的生产负载。

如何获取 GLM-5.3-Flash API Key

注册 TokenRa 账号,打开控制台,创建 API Key,确认账号已启用 GLM-5.3-Flash,然后从服务端发送兼容 OpenAI 的请求。请妥善保管 Key,并在投入生产前核对线上的模型标识符。

1

注册 TokenRa 账号

完成注册后打开 TokenRa 控制台。

2

创建 API Key

进入 API Key 或令牌页面创建 Key,并保存在服务端。

3

发送测试请求

确认已启用的模型 ID,用代表性负载测试,并补充生产环境控制措施。

curl https://tokenra.io/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"glm-5.3-flash","messages":[{"role":"user","content":"介绍一下 GLM-5.3-Flash 的架构"}]}'

GLM-5.3-Flash 模型规格

GLM-5.3-Flash 是 Z.ai(智谱 AI)GLM-5 系列中的首个原生多模态模型。投入生产前,请在 TokenRa 控制台确认当前启用的上下文长度、输出上限和支持的模态。

架构

3200 亿总参数 / 180 亿激活

混合稀疏注意力与线性注意力,面向长上下文推理的效率优化。

上下文

1,310,720 tokens

约 100 万 tokens 上下文,最高支持 131,072 tokens 的生成长度。

模态

文本 · 图像 · 视频转文本

在支持的集成上提供原生多模态输入与文本输出。

工具

函数调用 + JSON

支持 tools、tool_choice,以及通过 response_format 输出结构化结果。

提供方

Z.ai(智谱 AI)

GLM-5.3-Flash 此前曾以 Ox Alpha 代号进入预览。

模型 ID

glm-5.3-flash

在 API 请求中使用该标识符,并在线上控制台核对。

为什么用 GLM-5.3-Flash 做编程与智能体

GLM-5.3-Flash 把原生多模态输入、长上下文和高效推理结合在一起,适配实际的编程和智能体负载。

  • 把截图和视觉上下文与代码、文本指令一起使用。
  • 借助 100 万 tokens 上下文窗口处理长文档和代码仓库。
  • 在智能体工作流中结合规划、工具调用和视觉反馈。
  • 在线上集成中确认输出上限、工具支持情况和生产环境表现。

GLM-5.3-Flash 价格与可用性

GLM-5.3-Flash 通过 TokenRa 按用量透明计费:每 100 万输入 tokens $0.14,每 100 万输出 tokens $0.52,每 100 万缓存读取 tokens $0.04。开始使用无需绑定信用卡。访问权限取决于账号资格、提供方可用性和相应的速率限制;投入生产前请在 TokenRa 控制台核对线上信息。

输入

$0.14 / 100 万 tokens

GLM-5.3-Flash 的标准输入价格。

输出

$0.52 / 100 万 tokens

GLM-5.3-Flash 的生成输出价格。

速率限制

随活动调整

投入生产前请确认当前可用性、速率限制和优惠情况。

Z.ai(智谱 AI)

GLM-5.3-Flash 由 Z.ai(智谱 AI)开发和运营,此前曾以 Ox Alpha(预览代号) 进入预览。TokenRa 作为路由网关提供对它的 API 访问,不是该模型的开发者或所有者。

本次预览说明的数据处理

提示词和生成结果会被提供方留存,但不用于训练。在发送敏感或受监管的信息前,请先阅读提供方和 TokenRa 的相关条款。

生产环境检查清单

  • API Key 只保存在服务端,并按环境隔离凭据。
  • 在依赖 100 万 tokens 上下文和各类输入模态之前,先在线上集成中确认。
  • 运行代表性的编程、智能体、推理和视觉上下文负载。
  • 设置明确的超时、有上限的重试、链路追踪和应用侧预算。
  • 结合自身场景审阅数据处理方式、提供方条款、隐私要求和产出物权利。

GLM-5.3-Flash API 常见问题

什么是 GLM-5.3-Flash API?

GLM-5.3-Flash API 以兼容 OpenAI 的方式提供 GLM-5.3-Flash 的访问能力。该模型面向编程、持续智能体工作、复杂推理和生产负载。

如何获取 GLM-5.3-Flash API Key?

注册 TokenRa 账号,打开控制台,创建 API Key,确认已启用 GLM-5.3-Flash,然后在服务端集成中使用该 Key。

GLM-5.3-Flash 的价格是多少?

通过 TokenRa 使用时,每 100 万输入 tokens 为 $0.14,每 100 万输出 tokens 为 $0.52,每 100 万缓存读取 tokens 为 $0.04。请在线上控制台查看当前费率和额度限制。

GLM-5.3-Flash 由谁开发?

它由 Z.ai(智谱 AI)开发和运营。TokenRa 作为路由网关提供对它的 API 访问,不是该模型的开发者或所有者。

GLM-5.3-Flash 支持哪些输入?

已说明的能力包括文本、图像和视频输入,具体以当前启用的集成为准。

提示词和生成结果会被用于训练吗?

会被提供方留存,但不用于训练。

GLM-5.3-Flash 由 Z.ai(智谱 AI)开发。提供方及相关名称归各自权利人所有。TokenRa 作为路由网关提供 API 访问,不是该模型的开发者或所有者。