约 3040 亿 MoE · MIT 许可
混合专家架构,结合压缩稀疏注意力、高度压缩注意力和 mHC 优化。DSpark 投机解码支持高吞吐推理。开放权重以 MIT 许可提供,并附 vLLM 与 SGLang 部署方案。
使用 DeepSeek V4.1 Flash API 构建编程、持续智能体工作和复杂推理应用。按用量透明计费:输入 ¥2.48/M,输出 ¥9.98/M。按照下面的快速指南获取 API Key 并发送第一个请求。
DeepSeek V4.1 Flash(DeepSeek 4.1、DeepSeek Flash 4.1)面向长周期软件工程、复杂推理和生产使用。它提供 131 万 tokens 的上下文窗口(第三方平台所列),并原生支持文本、图像和视频输入,无需单独的视觉模型。V4.1 Flash 采用的模型架构旨在提升 Flash 档位的效率和生成速度。
混合专家架构,结合压缩稀疏注意力、高度压缩注意力和 mHC 优化。DSpark 投机解码支持高吞吐推理。开放权重以 MIT 许可提供,并附 vLLM 与 SGLang 部署方案。
可处理完整代码仓库、长文档和持续的智能体会话。支持三档 reasoning_effort:low、high 和 max,按任务在延迟与推理深度之间权衡。
原生集成文本、图像和视频输入。在早期 V4-Flash-Vision-Exp 实验分支的基础上,将多模态输入变为 Flash 档位的一等能力。
DeepSeek V4.1 Flash 为需要持续执行和生产级评估的负载提供快速推理能力。
注册 TokenRa 账号,打开控制台,创建 API Key,确认账号已启用 DeepSeek V4.1 Flash,然后从服务端发送兼容 OpenAI 的请求。请妥善保管 Key,并在投入生产前核对线上的模型标识符。
完成注册后打开 TokenRa 控制台。
进入 API Key 或令牌页面创建 Key,并保存在服务端。
确认已启用的模型 ID,用代表性负载测试,并补充生产环境控制措施。
curl https://tokenra.io/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-v4.1-flash","messages":[{"role":"user","content":"用简单的方式解释 MoE 架构。"}]}'DeepSeek V4.1 Flash 通过 TokenRa 按用量透明计费。当前费率如下;投入生产前请在 TokenRa 控制台确认线上费率和账号额度限制。
DeepSeek V4.1 Flash 输入 tokens 的 TokenRa 费率。
DeepSeek V4.1 Flash 输出 tokens 的 TokenRa 费率。
DeepSeek V4.1 Flash 缓存输入 tokens 的 TokenRa 费率。
你的 TokenRa API Key 可用于 DeepSeek V4.1 Flash、GLM-5.3-Flash、Seedance 2.5 以及账号下已启用的其他模型,无需单独申请 DeepSeek 提供方的 Key。请使用模型 ID deepseek-v4.1-flash,这是稳定的标识符。
提示词和生成结果会被提供方留存,但不用于训练。在发送敏感或受监管的信息前,请先阅读提供方和 TokenRa 的相关条款。
DeepSeek V4.1 Flash 更看重吞吐量和可预期的按用量计费,适合日常 API 负载。
DeepSeek V4.1 Flash API 以兼容 OpenAI 的方式提供 DeepSeek V4.1 Flash 的访问能力。该模型面向编程、持续智能体工作、复杂推理和生产负载。
注册 TokenRa 账号,打开控制台,创建 API Key,确认已启用 DeepSeek V4.1 Flash,然后在服务端集成中使用该 Key。
当前 TokenRa 费率为每 100 万输入 tokens ¥2.48,每 100 万输出 tokens ¥9.98,每 100 万缓存输入 tokens ¥0.27。请在 TokenRa 控制台确认当前费率和账号额度限制。
DeepSeek V4.1 Flash 由 DeepSeek 开发和运营。TokenRa 提供 API 网关服务,不是该模型的开发者或所有者。
DeepSeek V4.1 Flash 在已启用的集成上支持文本、图像和视频输入。
DeepSeek V4.1 Flash 是侧重效率的 Flash 版本。完整版的模型名称、能力和价格请在线上 TokenRa 控制台确认。
支持。本页说明了 low、high 和 max 三档 reasoning_effort,请在已启用的集成上验证支持情况。
当前页面描述其权重以 MIT 许可开放。在再分发或生产部署前,请确认适用的发布版本和部署条款。
会被提供方留存,但不用于训练。
DeepSeek 是 DeepSeek 的商标。TokenRa 是独立的 API 网关,与 DeepSeek 无从属关系,也未获得其背书或赞助。DeepSeek 及相关名称归各自权利人所有。TokenRa 不应被视为该模型的开发者或所有者。