Thinking Machine Lab,在新一代AI实验室(neo lab)中不是成立最早的,却是最先拿出开源模型的:Inkling。
其中一个重要的原因,是Inkling在MoE(混合专家模型)架构上借鉴了DeepSeek V3,在后训练强化学习的启动阶段,使用了Kimi 2.5生成的数据进行了初始的监督微调。
Inkling是一个开放权重的混合专家模型,9750亿参数(活跃410亿),支持百万上下文,用 45 万亿个token的文本、图像、音频和视频上进行了训练。
TML还发布了预览版Inkling-Small,这个轻巧一点的模型拥有2760亿参数,(120 亿活跃),训练方法类似,实现了更成本、更延迟和尽可能强的性能。
TML对外是两位女性联合创始人的面孔,一位是OpenAI的前CTO穆拉蒂(Mira Murati),一位是OpenAI前负责对齐研究的副总裁翁荔。
她们说Inkling优秀之处,在于它便于定制,包括多模态能力、高效的思维过程,以及在 Tinker 平台上的微调功能。它是一个更通用和均衡的模型,足够灵活,适应变化。
TML认为,持续推理(即test-time scaling)和解决问题的能力,对于每个模芯都很关键,但它们很难用榜单刷出来,开发者为了特定的任务微调模型,效率的重要性一点都不亚于在基础测试上煞费苦心地得到高分。在真实世界中,成本和延迟是更重要的因素。

不过还是要看下模型评测分数(参见文末附表):
在推理方面,Inkling在美国做到了SOTA,但仍弱于中国的Kimi K2.6和GLM 5.2。在智能体编程方面亦是如此。在通用智能体方面,Inkling超过了Kimi K2.6。
Inkling在视觉方面略逊于Kimi K2.6。它有语音能力,Kimi和GLM没有。它的聊天功能也略胜过GLM 5.2。在多模态方面,它与千问相当,弱于Gemini。
总之,Inkling的评测分数处于Kimi K2.6和GLM 5.2之间。在美国,业内认为它的性能相当于Opus 4.6 或者Gemini 3.5 flash。
美国终于有一家初创公司的开源模型,可以与中国同行掰手腕了,尽管在性能上有所不足,但它试图用通用性、灵活性和更方便的定制化,更好服务真实应用场景。
它想追求比中国模型“更值得信任和更安全”。
在事实性(factuality)方面,Inkling的得分更高(参见文附附表)。获取事实,并非让模型“死记硬背”大量的知识,而是恰当校准,在回答中表现出有分寸的信心,包括那些没有定论的答案,这在推演和预测中尤其重要。Inkling的微调模型提升很快,已经超过了领先的LLM(大语言模型)。
Inkling在模型的“内生安全”与对齐方面,胜过了中国风头最盛的GLM 5.2(参见文末附表)。它对一些危险功能——例如核生化防护、网络安全和失控——进行了内部评估并聘请了外部测试人员。还关注了人机交互威胁,包括阿谀奉承、恶意操纵和易受攻击的用户。在 FORTRESS 基准测试中,Inkling 在所有开放权重模型中表现出最强的内生安全保障。
训练方面,Inkling对MoE的设计采纳了DeepSeek-V3的框架。为了引导后训练,Inkling用开放权重模型(包括 Kimi K2.5)生成的合成数据运行了初始的监督微调。引导过程仅占用少量计算资源,大部分资源用于在合成环境和人工创建的环境上进行大规模强化学习。
Inkling基于NVIDIA GB300 NVL72 系统进行了训练将强化,学习规模扩大到超过3000万次迭代,并在两次长时间的连续运行中保持了稳定的训练。在整个过程中,推理性能呈对数线性增长,最终实现了显著的整体提升。未来的模型将进一步扩大预训练、后训练和强化学习的计算规模。
TML 认为,即使是最好的通用模型也无法很好地解决许多现实世界的问题,而通过利用组织专业知识进行微调可以弥补这一差距。
--
参考文献及数据:
https://thinkingmachines.ai/news/introducing-inkling/

4001102288 欢迎批评指正
All Rights Reserved 新浪公司 版权所有
