DeepSeek-V4-Flash

deepseek-v4-flash
开源DeepSeek 系列

概述

1M 上下文检索增强代码生成上下文缓存

DeepSeek-V4-Flash 是面向规模化在线业务推出的轻量级 MoE 文本模型,整体参数量 284B、单次推理仅激活约 13B。在保持长上下文理解能力的前提下,模型面向日常对话、检索增强、内容生产、客服、辅助编程以及长链路任务做了推理路径优化,单价相比同档位模型具备显著优势,适合高 QPS、低延迟与成本敏感型的接入场景。

百万上下文
1M token 上下文窗口,支持项目级代码库、超长文档与多轮会话一次性载入。
MoE 高效能
总参 284B / 激活 13B,单次推理更轻量,兼顾性能与算力开销。
极致性价比
单位 token 成本显著低于同级模型。
高吞吐低延迟
RPM 15K / TPM 1.20M,面向在线业务与高并发场景稳定输出。

功能

联网搜索
结构化输出
上下文缓存
批量任务
前缀补全
微调
视觉理解

定价

空闲时段
输入¥1.5/M tokens
输入(缓存命中)¥0.05/M tokens
输出¥4.5/M tokens
高峰时段
输入¥3/M tokens
输入(缓存命中)¥0.1/M tokens
输出¥9/M tokens
空闲时段价格为高峰时段价格的一半。高峰时段为北京时间周一至周五 9:00 - 12:00、14:00 - 18:00(其余为空闲时段)。

速率限制与上下文

上下文窗口1M
最大输出384K
RPM(请求 / 分钟)15K
TPM(token / 分钟)1200K

API 参考

ENDPOINT
POST https://api.tokenfab.cn/v1/chat/completions

请求示例

curl https://api.tokenfab.cn/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $TOKENFAB_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": "介绍一下你自己。"}
    ]
  }'

响应示例

JSON
{
  "id": "chatcmpl-2k8d91fz",
  "object": "chat.completion",
  "created": 1784950000,
  "model": "deepseek-v4-flash",
  "choices": [{
    "index": 0,
    "message": {
      "role": "assistant",
      "content": "我是 DeepSeek-V4-Flash,一款兼顾高性价比与高吞吐的 MoE 文本模型,总参数 284B、单次激活约 13B,支持百万级上下文窗口,适合大规模生产与在线业务使用。"
    },
    "finish_reason": "stop"
  }],
  "usage": {
    "prompt_tokens": 14,
    "completion_tokens": 46,
    "total_tokens": 60
  }
}

请求参数

参数类型必填说明
modelstring模型 ID,如 deepseek-v4-flash
messagesarray对话消息列表,含 role 和 content
temperaturefloat采样温度,0–2,默认 0.7
top_pfloat核采样,0–1,默认 0.9
max_tokensint最大输出 Token 数
streambool是否流式输出,默认 false
toolsarray工具定义列表,用于 Function Calling
tool_choicestring工具调用策略,auto / none / 指定函数