TokenRa模型目录
Kimi K2.8 Preview - 通过 TokenRa 接入编码模型

Kimi K2.8 Preview API:1M 上下文编码 Agent

使用一个 TokenRa API Key 调用 Moonshot AI 的 Kimi K2.8 Preview,用于代码补全、大型代码库重构、编码 Agent 和多模态开发工作流。它把 1M token 上下文窗口、可调思考强度与兼容 OpenAI 的接入方式结合在一起。

Kimi K2.8 Preview 是什么

Kimi K2.8 Preview 是 Moonshot AI 面向编码场景的模型,于 2026 年 9 月 11 日成为 Kimi Code 的默认引擎。它是对 Kimi Code 默认编码模型的静默升级,而不是一次独立的开放权重发布,具备 1M token 上下文窗口、可调思考强度和多模态输入能力。

01

编码与 Agent

面向代码补全、日常开发,以及需要长时间运行的编码 Agent 任务。

02

1M token 上下文

在 1,048,576 token 的上下文窗口中处理大型代码库、长文档和多轮历史。

03

思考强度可调

可选择 low、high 或 max 三档思考强度,默认为 max。

适用场景

它面向那些对长上下文、可调思考强度和 Agent 执行能力有要求的编码工作流。

  • 大型代码库重构:跨文件追踪依赖关系,实施协同改动,并运行测试验证结果。
  • 代码补全:把仓库上下文和明确需求转化为可直接落地的函数、模块与修复。
  • 编码 Agent:规划多步任务、调用工具、检查结果,并持续迭代直到任务完成。
  • 截图与录屏转代码:利用图片和视频输入还原界面、定位视觉缺陷并优化渲染效果。

架构与 Agent 能力

Kimi K2.8 Preview 是通过 Kimi Code 和已启用的 API 网关提供的托管编码模型升级。本页不提供可下载的权重包;部署与访问细节请参考 Moonshot AI 官方文档。

  • 原生多模态:支持文本、图片和视频输入,适合需要视觉反馈的工作流。
  • 推理控制:可通过 reasoning_effort 设置 low、high、max 三档思考强度。关闭思考后,请求会路由到 Kimi K2.8 Preview 的非思考版本。
  • 工具能力:支持 Function calling、tool_choice 和 JSON Schema 结构化输出,便于 Agent 集成。
  • 发布形式:Kimi K2.8 Preview 是对 Kimi Code 默认编码模型的静默升级,不是可单独下载的开放权重版本。

Kimi K2.8 Preview vs Kimi K3 vs K2.7 Code HighSpeed

三个模型同属 Kimi Code 家族。请结合能力、上下文、推理深度和输出速度来选择。

对比项Kimi K3K2.8 PreviewK2.7 Code(HighSpeed)
定位面向大型项目、深度推理和复杂长上下文 Agent 的最强旗舰。接近 K3 的表现,思考效率更高;推荐作为日常编码模型。上一代编码模型,面向速度优先的场景。
模型 IDk3 / k3-256kkimi-for-coding(Kimi Code 官方)/ kimi-k2.8-preview(TokenRa 网关)kimi-for-coding-highspeed
参数规模2.8T 旗舰级 MoE 模型。官方未公开;表现据称接近 K3。上一代 K2 系列编码模型。
上下文窗口受支持档位最高 1M;实际可用上下文以控制台为准。各会员档位均可用到 1M。256K。
思考强度low / high / max,默认 high。low / high / max,默认 max。思考固定开启,无法关闭。
编码与 Agent 能力最适合长周期工程与深度推理。在代码补全、日常开发和编码 Agent 上接近 K3。能力仍然不弱,但整体弱于新一代模型。
多模态输入图片 + 视频。图片 + 视频。图片 + 视频。
输出速度标准。标准。HighSpeed 版本约快 5-6 倍。
可用性需较高会员档位;各档位可用情况不同,请在控制台确认。全部会员档位可用。HighSpeed 可用情况不同,请在控制台确认。
API 参考价格价格因渠道而异,请以实时控制台为准。TokenRa:每 1M token 输入 $0.80 / 输出 $3.35 / 缓存读取 $0.14。价格因渠道而异,请以实时控制台为准。
适合选择追求极限能力。日常编码与性价比。追求最快输出速度。
  • 选 Kimi K3:需要最强模型处理大型项目、深度推理和复杂长上下文 Agent 任务,并且能接受更高的会员门槛与用量成本。
  • 选 Kimi K2.8 Preview:用于日常开发并看重性价比——表现据称接近 K3,思考效率更高,且全部会员档位都能用到 1M 上下文。
  • 选 Kimi K2.7 Code HighSpeed:仅在输出速度是首要指标时选择;它是上一代方案,在上下文、思考效率和整体能力上均已被 K2.8 Preview 超越。

为编码 Agent 接入 Kimi K2.8

只把任务真正需要的仓库文件和跨文件依赖装入 1M token 窗口,然后让 Agent 运行测试、检查 diff,并验证改动是否真的生效。

1

装载仓库上下文

按需组装相关模块和依赖,而不是每次请求都发送整个仓库。

2

执行并验证任务

让 Agent 完成改动、运行测试套件、检查 diff,并报告失败项及可能原因。

3

控制 token 与成本

缓存读取约比标准输入便宜 5.7 倍。请围绕缓存命中来设计请求,并为每次请求设置输出上限。

curl https://tokenra.io/zen/go/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"kimi-k2.8-preview","messages":[{"role":"user","content":"请重构附带的模块以消除重复状态,运行测试套件,并说明哪些测试失败及可能原因。"}],"reasoning_effort":"high"}'

价格

Kimi K2.8 Preview 在 TokenRa 上是付费模型。当前费率为:每 100 万输入 token $0.80,每 100 万输出 token $3.35,每 100 万缓存读取 token $0.14。实际可用性和账户限额请以实时控制台为准。

输入

$0.80 / 1M tokens

标准输入价格。

输出

$3.35 / 1M tokens

生成输出价格。

缓存读取

$0.14 / 1M tokens

缓存输入读取价格。

Moonshot AI 模型

Kimi K2.8 Preview 由 Moonshot AI 开发。TokenRa 提供 API 网关服务,并非该模型的开发方或所有方。

上线前检查清单

  • API Key 只保存在服务端,并按环境或业务线区分凭据。
  • 在接入真实流量前,设置明确的超时、有上限的重试和请求追踪。
  • 用有代表性的输入做评测,不要默认不同版本可以直接互换。
  • 在控制台监控用量和成本,并在应用侧增加预算与限额。
  • 结合自身场景确认服务条款、隐私要求和输出内容的权利归属。

API 常见问题

Kimi K2.8 Preview 是全新模型吗?

Kimi K2.8 Preview 是对 Kimi Code 默认编码模型的静默升级,而不是一个可单独下载的独立模型。

需要修改 Kimi Code 的配置吗?

不需要。Kimi Code 官方默认标识仍为 kimi-for-coding,现有客户端无需改配置即可继续使用。

Kimi K2.8 Preview 的上下文窗口有多大?

Kimi K2.8 Preview 在各会员档位均支持 1M token 上下文窗口。

Kimi K2.8 Preview 和 Kimi K3 该选哪个?

最难的长周期任务追求极限能力时选 Kimi K3;日常编码、思考效率和全档位 1M 上下文选 Kimi K2.8 Preview。

可以关闭思考吗?

可以。关闭思考后请求会路由到 Kimi K2.8 Preview 的非思考版本。

思考强度有哪些级别?

Kimi K2.8 Preview 支持 low、high 和 max 三档思考强度,默认为 max。

「Kimi」「Moonshot AI」及相关名称可能为其各自权利人的商标。TokenRa 是独立的 API 网关,本页不是官方厂商页面,也不构成任何背书。

最后更新:2026 年 9 月