量子位 · 站内详情

菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3

2026/9/7 16:36:30 · 模型更新

“在两个模型之间找到数学上的共同基础其实非常困难”

来源
量子位
时间
2026/9/7 16:36:30
标签
模型更新
分类
国产模型与应用竞争

正文

“在两个模型之间找到数学上的共同基础其实非常困难”

衡宇 发自 凹非寺

量子位 | 公众号 QbitAI

GPT-6 Astra刷到快满分的ARC-AGI 3, 一个手机能跑的4B小模型也能刷爆 。

更准确地说,是4B Qwen+753B GLM 5.2的组合。

其中,GLM-5.2待在云端,手机端只需运行4B的Qwen-3.5。大模型全程不输出一个字,小模型负责把最终答案写出来。

具体技术细节尚未公开,背后团队Mostik拒绝在此刻披露,“因为比赛还没结束”。

但他们公开了核心发现:

AI模型之间一直在用一种极其低效的方式交流。

Mostik认为,他们搭了一座桥,让模型之间的信息传递效率提升了几个数量级。

按团队披露的实验结果,这套方案能让4B模型补上与753B模型之间约50%的性能差距,自身准确率提高25%。在大小模型差距更明显的难题子集上,提升达到2倍。

而大模型侧的推理成本,被压到了原本约二十分之一。

Mostik成立仅4个月,团队共15人,其中12名博士。

团队里还有一位菲尔兹奖得主——2010年证明了统计物理中“渗流模型”和“平面Ising模型”的共形不变性的俄罗斯数学家 Stanislav Smirnov (斯坦尼斯拉夫·斯米尔诺夫)。

两兆字节与十七比特 大模型生成一个token的过程中,内部会构建超过一百个隐藏向量,总共包含大约一百万个数值,约两兆字节的内部状态信息。

然后,它从大约15万词的词表中挑出一个token输出。

17个比特离开模型,两兆字节被丢弃,不会再被使用。

目前所有让多个模型协作的系统,包括编程子智能体、模型委员会、路由调度,全部建立在这17个比特之上。

来源说明

本站展示来自正式来源同步的内容摘录与本地观察,不默认跳转外网;需要核验上下文时可查看来源记录。