
GLM-5.3-Flash
glm-5.3-flash开源GLM 系列NEW
概述
多模态1M 上下文视觉理解代码生成智能体
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,采用 320B-A18B 稀疏注意力与线性注意力混合架构,是全球首个采用该混合架构的开源前沿模型。它在 Artificial Analysis Intelligence Index(AA 综合智能指数)取得 57 分,与 Claude Opus 4.8 持平、全面超越 GLM-5.2。视觉能力被原生融入 Coding 循环,模型能主动观察界面、渲染结果与交互反馈并持续改进,在代码、浏览器与图形界面之间协同完成任务;同时拓展至 Office、金融研究、专业文档等场景,可自主拆解目标、调用工具并交付 PPTX、PDF、DOCX、XLSX 等成品。定价仅为 GLM-5.3 的 1/10,让前沿智能第一次不用省着用。
极致低成本架构
稀疏注意力 + 线性注意力混合,注意力计算量与 KV 缓存较 GLM-5.3 分别降低 3.01 倍、4.44 倍。
原生多模态视觉 Coding
视觉能力原生融入编码循环,主动观察界面、渲染结果与交互反馈并持续改进。
超越 Coding 的工作伙伴
拓展至 Office、金融研究、专业文档,交付 PPTX / PDF / DOCX / XLSX 高质量成品。
百万上下文
1M token 上下文窗口、最大输出 128K,支持项目级代码库与超长文档一次性载入。
功能
视觉理解图片 / 视频 / 文件✓
深度思考low / high / max,推荐 max;始终启用,不支持禁用✓
流式输出✓
工具调用多种外部工具集成✓
上下文缓存优化长对话性能✓
结构化输出JSON 等格式✓
联网搜索✕
批量任务✕
前缀补全✕
微调✕
定价
输入¥0.8/M tokens
输入(缓存命中)¥0.23/M tokens
输出¥2.8/M tokens
目录价为 GLM-5.3 的 1/10,与官方一致;限时 5 折活动至 2026-09-09 24:00(输入 ¥0.4 / 缓存 ¥0.115 / 输出 ¥1.4)。最终账单以控制台展示和实际 Token 用量为准。
速率限制与上下文
上下文窗口1M
最大输出128K
RPM(请求 / 分钟)200
TPM(token / 分钟)3M
API 参考
ENDPOINT
POST https://api.tokenfab.cn/v1/chat/completions
请求示例
curl https://api.tokenfab.cn/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $TOKENFAB_API_KEY" \
-d '{
"model": "glm-5.3-flash",
"thinking": { "type": "enabled", "clear_thinking": false },
"reasoning_effort": "max",
"temperature": 1,
"top_p": 0.95,
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": [
{"type": "text", "text": "请分析这张界面截图,指出布局与交互问题并给出改进建议。"},
{"type": "image_url", "image_url": {"url": "https://cdn.example.com/ui.png"}}
]}
]
}'响应示例
JSON
{
"id": "chatcmpl-glm53f-8e3j9a2",
"object": "chat.completion",
"created": 1784950000,
"model": "glm-5.3-flash",
"choices": [{
"index": 0,
"message": {
"role": "assistant",
"content": "界面主要存在三处问题:1) 顶部导航栏与内容区未对齐,留白不均;2) 主按钮颜色对比度不足,弱化操作引导;3) 表单校验提示位置不统一。建议统一栅格、强化主按钮视觉权重,并将校验提示统一至输入框下方。"
},
"finish_reason": "stop"
}],
"usage": {
"prompt_tokens": 512,
"completion_tokens": 186,
"total_tokens": 698
}
}请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
| model | string | ✓ | 模型 ID,填 glm-5.3-flash |
| messages | array | ✓ | 对话消息列表;content 可为字符串或含 image_url 的多模态内容块 |
| thinking | object | — | 思考配置,{"type":"enabled"}(仅支持启用,不支持禁用);建议 clear_thinking:false |
| reasoning_effort | enum | — | 思考强度:low / high / max,推荐 max |
| temperature | float | — | 采样温度,0–2,推荐 1 |
| top_p | float | — | 核采样,0–1,推荐 0.95 |
| max_tokens | int | — | 最大输出 Token 数 |
| stream | bool | — | 是否流式输出,默认 false;建议同时开启 tool_stream |
| tools | array | — | 工具定义列表,用于 Function Calling |
| tool_choice | string | — | 工具调用策略,auto / none / 指定函数 |