TokenRa模型广场
DeepSeek V4.1 Flash · 通过 TokenRa 按 token 计费

DeepSeek V4.1 Flash API - 输入 ¥2.48/M,131 万上下文

使用 DeepSeek V4.1 Flash API 构建编程、持续智能体工作和复杂推理应用。按用量透明计费:输入 ¥2.48/M,输出 ¥9.98/M。按照下面的快速指南获取 API Key 并发送第一个请求。

¥2.48 输入每 100 万输入 tokens。
¥9.98 输出每 100 万输出 tokens。
¥0.27 缓存每 100 万缓存输入 tokens。

面向编程和持续智能体工作

DeepSeek V4.1 Flash(DeepSeek 4.1、DeepSeek Flash 4.1)面向长周期软件工程、复杂推理和生产使用。它提供 131 万 tokens 的上下文窗口(第三方平台所列),并原生支持文本、图像和视频输入,无需单独的视觉模型。V4.1 Flash 采用的模型架构旨在提升 Flash 档位的效率和生成速度。

01

约 3040 亿 MoE · MIT 许可

混合专家架构,结合压缩稀疏注意力、高度压缩注意力和 mHC 优化。DSpark 投机解码支持高吞吐推理。开放权重以 MIT 许可提供,并附 vLLM 与 SGLang 部署方案。

02

131 万 tokens 上下文

可处理完整代码仓库、长文档和持续的智能体会话。支持三档 reasoning_effort:low、high 和 max,按任务在延迟与推理深度之间权衡。

03

原生多模态(V4.1)

原生集成文本、图像和视频输入。在早期 V4-Flash-Vision-Exp 实验分支的基础上,将多模态输入变为 Flash 档位的一等能力。

适用场景

DeepSeek V4.1 Flash 为需要持续执行和生产级评估的负载提供快速推理能力。

  • 长周期的软件工程与编程任务。
  • 适合结构化评估的复杂推理任务。
  • 结合规划、工具调用和应用校验的智能体工作流。
  • 需要在质量、延迟、错误率和用量上做代表性测试的生产负载。

如何获取 DeepSeek V4.1 Flash API Key

注册 TokenRa 账号,打开控制台,创建 API Key,确认账号已启用 DeepSeek V4.1 Flash,然后从服务端发送兼容 OpenAI 的请求。请妥善保管 Key,并在投入生产前核对线上的模型标识符。

1

注册 TokenRa 账号

完成注册后打开 TokenRa 控制台。

2

创建 API Key

进入 API Key 或令牌页面创建 Key,并保存在服务端。

3

发送测试请求

确认已启用的模型 ID,用代表性负载测试,并补充生产环境控制措施。

curl https://tokenra.io/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4.1-flash","messages":[{"role":"user","content":"用简单的方式解释 MoE 架构。"}]}'

DeepSeek V4.1 Flash API 价格

DeepSeek V4.1 Flash 通过 TokenRa 按用量透明计费。当前费率如下;投入生产前请在 TokenRa 控制台确认线上费率和账号额度限制。

输入

¥2.48 / 100 万 tokens

DeepSeek V4.1 Flash 输入 tokens 的 TokenRa 费率。

输出

¥9.98 / 100 万 tokens

DeepSeek V4.1 Flash 输出 tokens 的 TokenRa 费率。

缓存输入

¥0.27 / 100 万 tokens

DeepSeek V4.1 Flash 缓存输入 tokens 的 TokenRa 费率。

一个 Key,通用于已启用的模型

你的 TokenRa API Key 可用于 DeepSeek V4.1 Flash、GLM-5.3-Flash、Seedance 2.5 以及账号下已启用的其他模型,无需单独申请 DeepSeek 提供方的 Key。请使用模型 ID deepseek-v4.1-flash,这是稳定的标识符。

数据处理

提示词和生成结果会被提供方留存,但不用于训练。在发送敏感或受监管的信息前,请先阅读提供方和 TokenRa 的相关条款。

DeepSeek V4.1 Flash 与 V3、R1 的对比

DeepSeek V4.1 Flash 更看重吞吐量和可预期的按用量计费,适合日常 API 负载。

  • 与 DeepSeek V3 相比 —— Flash 面向快速编程、对话和智能体请求设计,配备 100 万 tokens 上下文窗口。
  • 与 DeepSeek R1 相比 —— 当吞吐量和延迟比极致推理深度更重要时,Flash 是更务实的选择。
  • 投入生产前,请在 TokenRa 控制台确认线上的模型阵容、能力和限制。

生产环境检查清单

  • API Key 只保存在服务端,并按环境隔离凭据。
  • 在依赖 100 万 tokens 上下文和各类输入模态之前,先在线上集成中确认。
  • 用代表性的编程、智能体、推理和视觉上下文负载做评估。
  • 设置明确的超时、有上限的重试、链路追踪和应用侧预算。
  • 结合自身场景审阅数据处理方式、提供方条款、隐私要求和产出物权利。

DeepSeek V4.1 Flash API 常见问题

什么是 DeepSeek V4.1 Flash API?

DeepSeek V4.1 Flash API 以兼容 OpenAI 的方式提供 DeepSeek V4.1 Flash 的访问能力。该模型面向编程、持续智能体工作、复杂推理和生产负载。

如何获取 DeepSeek V4.1 Flash API Key?

注册 TokenRa 账号,打开控制台,创建 API Key,确认已启用 DeepSeek V4.1 Flash,然后在服务端集成中使用该 Key。

DeepSeek V4.1 Flash API 的价格是多少?

当前 TokenRa 费率为每 100 万输入 tokens ¥2.48,每 100 万输出 tokens ¥9.98,每 100 万缓存输入 tokens ¥0.27。请在 TokenRa 控制台确认当前费率和账号额度限制。

DeepSeek V4.1 Flash 由谁开发?

DeepSeek V4.1 Flash 由 DeepSeek 开发和运营。TokenRa 提供 API 网关服务,不是该模型的开发者或所有者。

DeepSeek V4.1 Flash 支持哪些输入?

DeepSeek V4.1 Flash 在已启用的集成上支持文本、图像和视频输入。

DeepSeek V4.1 Flash 和 DeepSeek V4.1 有什么区别?

DeepSeek V4.1 Flash 是侧重效率的 Flash 版本。完整版的模型名称、能力和价格请在线上 TokenRa 控制台确认。

DeepSeek V4.1 Flash 支持 reasoning_effort 吗?

支持。本页说明了 low、high 和 max 三档 reasoning_effort,请在已启用的集成上验证支持情况。

DeepSeek V4.1 Flash 是开源的吗?

当前页面描述其权重以 MIT 许可开放。在再分发或生产部署前,请确认适用的发布版本和部署条款。

提示词和生成结果会被用于训练吗?

会被提供方留存,但不用于训练。

DeepSeek 是 DeepSeek 的商标。TokenRa 是独立的 API 网关,与 DeepSeek 无从属关系,也未获得其背书或赞助。DeepSeek 及相关名称归各自权利人所有。TokenRa 不应被视为该模型的开发者或所有者。