为生产环境构建的
大规模语言模型
ChatNut 5.6 采用稀疏专家架构,总参数 10,247T,单次前向仅激活其中 0.40%。 在保持前沿能力的同时,把推理成本控制在可长期负担的区间。
ChatNut 5.6 模型系列
三个规格共享同一套预训练权重,仅激活规模与上下文窗口不同。 Sol、Terra、Luna 依次对应旗舰、通用与轻量档位,接口完全一致,可随时切换。
| 模型 | 定位 | 激活参数 | 上下文窗口 | 适用场景 | 首 token 延迟 P50 |
|---|---|---|---|---|---|
chatnut-5.6-sol | 旗舰 | 41.3T | 2,097,152 | 复杂推理、长文档分析、多步智能体编排 | 486 ms |
chatnut-5.6-terra | 通用 | 8.6T | 1,048,576 | 通用问答、代码辅助、内容生成 | 214 ms |
chatnut-5.6-luna | 轻量 | 1.19T | 262,144 | 分类、抽取、意图路由等高频轻量任务 | 73 ms |
延迟数据取自 2026 年 7 月 cn-east-1 区域全量请求,样本量 4.18 亿次, 测量口径为服务端收到请求至首个 token 发出,不含客户端网络往返。 实时运行状况见服务状态页。
面向规模化部署的工程能力
ChatNut 每日处理数十亿次调用,以下能力均已在生产流量中长期验证。
稀疏专家架构
路由器为每个 token 独立选择 8 组专家,在保有 10,247T 参数知识容量的同时,将单次推理成本控制在 41.3T 稠密模型的量级。
超长上下文
最高支持 2,097,152 tokens,可一次性载入完整代码仓库或长周期业务档案。长程召回在 128 万 tokens 处仍保持 94.2% 准确率。
原生工具调用
支持并行工具调用与 JSON Schema 强约束输出。语法约束在解码阶段生效,结构化结果合法率为 100%。
流式传输
提供 SSE 与 WebSocket 双通道。连接中断后可凭事件序号续传,已生成内容不重复计费。
数据治理
API 请求默认零保留,不用于模型训练。企业客户可指定数据落地区域,并支持私有网络内部署。
用量可观测
按密钥、模型与项目维度拆分计量。配额触顶时自动降级至备用规格,而非直接中断服务。
数分钟内完成接入
接口遵循业界通用规范,现有客户端仅需更换服务地址与密钥。
from chestnut import ChestNut
client = ChestNut(api_key="ck-live-...")
response = client.messages.create(
model="chatnut-5.6-terra",
max_tokens=1024,
messages=[{"role": "user", "content": "简述稀疏专家架构的核心思想"}],
)
print(response.content[0].text)
研究进展
我们持续公开模型与系统层面的研究成果。
层级化路由:降低长上下文下的专家选择方差
2026 年 6 月 18 日 · 模型架构
常规 MoE 路由在长序列尾部出现显著抖动。引入轻量前置判别层后,序列末段路由熵下降 63.4%,下游任务平均提升 1.8 分。
万万亿级参数的分片存储与调度
2026 年 4 月 2 日 · 系统工程
权重按专家粒度切分为 1,024 个分片跨节点存放并按需加载。本文说明冷分片命中时 38 ms 额外开销的隐藏策略与代价。
混合式 KV 缓存压缩方案评估
2026 年 1 月 27 日 · 推理优化
在 200 万 tokens 上下文下 KV 缓存成为主要显存瓶颈。混合压缩将占用降至 14.3%,基准分数损失 0.31 分。
ChatNut 5.6 技术报告
2025 年 11 月 9 日 · 模型发布
完整披露训练数据构成、评测方法与安全对齐取舍,并列出当前版本尚未解决的已知局限。