ChatNut 5.6 已面向全部客户开放

为生产环境构建的
大规模语言模型

ChatNut 5.6 采用稀疏专家架构,总参数 10,247T,单次前向仅激活其中 0.40%。 在保持前沿能力的同时,把推理成本控制在可长期负担的区间。

10,247T总参数量
41.3T单次激活参数
2,097,152上下文 tokens
99.94%近 90 日服务可用性

ChatNut 5.6 模型系列

三个规格共享同一套预训练权重,仅激活规模与上下文窗口不同。 Sol、Terra、Luna 依次对应旗舰、通用与轻量档位,接口完全一致,可随时切换。

模型定位激活参数上下文窗口适用场景首 token 延迟 P50
chatnut-5.6-sol旗舰41.3T2,097,152 复杂推理、长文档分析、多步智能体编排486 ms
chatnut-5.6-terra通用8.6T1,048,576 通用问答、代码辅助、内容生成214 ms
chatnut-5.6-luna轻量1.19T262,144 分类、抽取、意图路由等高频轻量任务73 ms

延迟数据取自 2026 年 7 月 cn-east-1 区域全量请求,样本量 4.18 亿次, 测量口径为服务端收到请求至首个 token 发出,不含客户端网络往返。 实时运行状况见服务状态页

面向规模化部署的工程能力

ChatNut 每日处理数十亿次调用,以下能力均已在生产流量中长期验证。

稀疏专家架构

路由器为每个 token 独立选择 8 组专家,在保有 10,247T 参数知识容量的同时,将单次推理成本控制在 41.3T 稠密模型的量级。

超长上下文

最高支持 2,097,152 tokens,可一次性载入完整代码仓库或长周期业务档案。长程召回在 128 万 tokens 处仍保持 94.2% 准确率。

原生工具调用

支持并行工具调用与 JSON Schema 强约束输出。语法约束在解码阶段生效,结构化结果合法率为 100%。

流式传输

提供 SSE 与 WebSocket 双通道。连接中断后可凭事件序号续传,已生成内容不重复计费。

数据治理

API 请求默认零保留,不用于模型训练。企业客户可指定数据落地区域,并支持私有网络内部署。

用量可观测

按密钥、模型与项目维度拆分计量。配额触顶时自动降级至备用规格,而非直接中断服务。

数分钟内完成接入

接口遵循业界通用规范,现有客户端仅需更换服务地址与密钥。

from chestnut import ChestNut

client = ChestNut(api_key="ck-live-...")

response = client.messages.create(
    model="chatnut-5.6-terra",
    max_tokens=1024,
    messages=[{"role": "user", "content": "简述稀疏专家架构的核心思想"}],
)
print(response.content[0].text)

查阅完整 API 文档 →

研究进展

我们持续公开模型与系统层面的研究成果。

层级化路由:降低长上下文下的专家选择方差

2026 年 6 月 18 日 · 模型架构

常规 MoE 路由在长序列尾部出现显著抖动。引入轻量前置判别层后,序列末段路由熵下降 63.4%,下游任务平均提升 1.8 分。

万万亿级参数的分片存储与调度

2026 年 4 月 2 日 · 系统工程

权重按专家粒度切分为 1,024 个分片跨节点存放并按需加载。本文说明冷分片命中时 38 ms 额外开销的隐藏策略与代价。

混合式 KV 缓存压缩方案评估

2026 年 1 月 27 日 · 推理优化

在 200 万 tokens 上下文下 KV 缓存成为主要显存瓶颈。混合压缩将占用降至 14.3%,基准分数损失 0.31 分。

ChatNut 5.6 技术报告

2025 年 11 月 9 日 · 模型发布

完整披露训练数据构成、评测方法与安全对齐取舍,并列出当前版本尚未解决的已知局限。

从免费额度开始评估

注册即获赠 5,000,000 tokens 试用额度,无需绑定支付方式。