
蒸馏出来的学生模型证券配资官网入口,把当老师的反超了。
Thinking Machines 今天放出 Inkling-Small,总参数 276B、激活 12B,体量大约是 Inkling 大杯板的四分之一。
元股证券:ygzq.hk

成绩单是这样的:HLE 31.6% 对 29.7%,SWEBench Verified 突破 80% 对 77.6%。
通用推理和智能体编程两条线上,学生都站到了老师前面。

蒸馏出来的小模型在个别指标上超过教师还不算,真正值得琢磨的是官方给反超公开的秘密配方。
过去说"小模型超过大模型",大概率是挑了一个最有利小模型的思考强度档位,和一个最有利的基准。
这次不太一样。
Humanity ’ s Last Exam 上,Inkling-Small 得 31.6%,高于 Inkling 的 29.7%,
而且在同等算力成本下几乎都成立,小模型的 test-time compute 曲线自始至终位于大模型之上。

如果把几周前随 Inkling 一起发的 Inkling-Small 预览版拉过来对照,进步的幅度就更清楚了:HLE 纯文本从 29.6% 到 31.6%,SWEBench Verified 从 77.4% 到 80% 以上,Audio MC 从 49.6% 到 54.9%。几个月时间,同一个模型家族里的小号自己又往上走了一截。

但这份公告同时也澄清了小模型能力的边界。
大模型在知识覆盖和事实性上依然占优,Inkling-Small 的预览版阶段 SimpleQA Verified 是 20.9%,Inkling 那边是 43.9%,差了一倍还多。
预览版在 Terminal Bench 2.1 上是 52.7%,同期 Inkling 是 63.8%,而且 Inkling 那个成绩里还有少量被判定为受网页搜索污染的解答被直接记了 0 分。

所以更适合这样理解:小模型追上来的是推理和编程这类靠训练强化的能力,追不上的是靠参数量的硬知识含量。
Inkling-Small 是在 Inkling 之后才开始训练的,这个时间差被团队完整地利用了。
第一步在预训练,团队调整了 Inkling-Small 的预训练数据配比和机器学习 recipe。
第二步在后训练,预览版检查点的后训练部分用了以 Inkling 作为教师的在线策略蒸馏。
炒股杠杆开户第三步是从预览检查点接着往下走,专门针对智能体编程又扩展了两周的强化学习。

这三步里最关键的是后两步的叠加关系:小模型先吃到了大模型的知识蒸馏,然后又额外拿到两周的专项 RL 加成。
说明在同一套 post-training 方法上继续投算力,回报还没到边际递减的位置。
参考链接:
[ 1 ] https://thinkingmachines.ai/model-card/inkling-small/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展每日见证券配资官网入口
优配网提示:本文来自互联网,不代表本网站观点。