GLM-5.3-Flash

glm-5.3-flash
开源GLM 系列NEW

概述

多模态1M 上下文视觉理解代码生成智能体

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,采用 320B-A18B 稀疏注意力与线性注意力混合架构,是全球首个采用该混合架构的开源前沿模型。它在 Artificial Analysis Intelligence Index(AA 综合智能指数)取得 57 分,与 Claude Opus 4.8 持平、全面超越 GLM-5.2。视觉能力被原生融入 Coding 循环,模型能主动观察界面、渲染结果与交互反馈并持续改进,在代码、浏览器与图形界面之间协同完成任务;同时拓展至 Office、金融研究、专业文档等场景,可自主拆解目标、调用工具并交付 PPTX、PDF、DOCX、XLSX 等成品。定价仅为 GLM-5.3 的 1/10,让前沿智能第一次不用省着用。

极致低成本架构
稀疏注意力 + 线性注意力混合,注意力计算量与 KV 缓存较 GLM-5.3 分别降低 3.01 倍、4.44 倍。
原生多模态视觉 Coding
视觉能力原生融入编码循环,主动观察界面、渲染结果与交互反馈并持续改进。
超越 Coding 的工作伙伴
拓展至 Office、金融研究、专业文档,交付 PPTX / PDF / DOCX / XLSX 高质量成品。
百万上下文
1M token 上下文窗口、最大输出 128K,支持项目级代码库与超长文档一次性载入。

功能

视觉理解图片 / 视频 / 文件
深度思考low / high / max,推荐 max;始终启用,不支持禁用
流式输出
工具调用多种外部工具集成
上下文缓存优化长对话性能
结构化输出JSON 等格式
联网搜索
批量任务
前缀补全
微调

定价

输入¥0.8/M tokens
输入(缓存命中)¥0.23/M tokens
输出¥2.8/M tokens
目录价为 GLM-5.3 的 1/10,与官方一致;限时 5 折活动至 2026-09-09 24:00(输入 ¥0.4 / 缓存 ¥0.115 / 输出 ¥1.4)。最终账单以控制台展示和实际 Token 用量为准。

速率限制与上下文

上下文窗口1M
最大输出128K
RPM(请求 / 分钟)200
TPM(token / 分钟)3M

API 参考

ENDPOINT
POST https://api.tokenfab.cn/v1/chat/completions

请求示例

curl https://api.tokenfab.cn/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $TOKENFAB_API_KEY" \
  -d '{
    "model": "glm-5.3-flash",
    "thinking": { "type": "enabled", "clear_thinking": false },
    "reasoning_effort": "max",
    "temperature": 1,
    "top_p": 0.95,
    "messages": [
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": [
        {"type": "text", "text": "请分析这张界面截图,指出布局与交互问题并给出改进建议。"},
        {"type": "image_url", "image_url": {"url": "https://cdn.example.com/ui.png"}}
      ]}
    ]
  }'

响应示例

JSON
{
  "id": "chatcmpl-glm53f-8e3j9a2",
  "object": "chat.completion",
  "created": 1784950000,
  "model": "glm-5.3-flash",
  "choices": [{
    "index": 0,
    "message": {
      "role": "assistant",
      "content": "界面主要存在三处问题:1) 顶部导航栏与内容区未对齐,留白不均;2) 主按钮颜色对比度不足,弱化操作引导;3) 表单校验提示位置不统一。建议统一栅格、强化主按钮视觉权重,并将校验提示统一至输入框下方。"
    },
    "finish_reason": "stop"
  }],
  "usage": {
    "prompt_tokens": 512,
    "completion_tokens": 186,
    "total_tokens": 698
  }
}

请求参数

参数类型必填说明
modelstring模型 ID,填 glm-5.3-flash
messagesarray对话消息列表;content 可为字符串或含 image_url 的多模态内容块
thinkingobject思考配置,{"type":"enabled"}(仅支持启用,不支持禁用);建议 clear_thinking:false
reasoning_effortenum思考强度:low / high / max,推荐 max
temperaturefloat采样温度,0–2,推荐 1
top_pfloat核采样,0–1,推荐 0.95
max_tokensint最大输出 Token 数
streambool是否流式输出,默认 false;建议同时开启 tool_stream
toolsarray工具定义列表,用于 Function Calling
tool_choicestring工具调用策略,auto / none / 指定函数