量子位 · 站内详情
菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3
“在两个模型之间找到数学上的共同基础其实非常困难”
- 来源
- 量子位
- 时间
- 2026/9/7 16:36:30
- 标签
- 模型更新
- 分类
- 国产模型与应用竞争
正文
“在两个模型之间找到数学上的共同基础其实非常困难”
衡宇 发自 凹非寺
量子位 | 公众号 QbitAI
GPT-6 Astra刷到快满分的ARC-AGI 3, 一个手机能跑的4B小模型也能刷爆 。
更准确地说,是4B Qwen+753B GLM 5.2的组合。
其中,GLM-5.2待在云端,手机端只需运行4B的Qwen-3.5。大模型全程不输出一个字,小模型负责把最终答案写出来。
具体技术细节尚未公开,背后团队Mostik拒绝在此刻披露,“因为比赛还没结束”。
但他们公开了核心发现:
AI模型之间一直在用一种极其低效的方式交流。
Mostik认为,他们搭了一座桥,让模型之间的信息传递效率提升了几个数量级。
按团队披露的实验结果,这套方案能让4B模型补上与753B模型之间约50%的性能差距,自身准确率提高25%。在大小模型差距更明显的难题子集上,提升达到2倍。
而大模型侧的推理成本,被压到了原本约二十分之一。
Mostik成立仅4个月,团队共15人,其中12名博士。
团队里还有一位菲尔兹奖得主——2010年证明了统计物理中“渗流模型”和“平面Ising模型”的共形不变性的俄罗斯数学家 Stanislav Smirnov (斯坦尼斯拉夫·斯米尔诺夫)。
两兆字节与十七比特 大模型生成一个token的过程中,内部会构建超过一百个隐藏向量,总共包含大约一百万个数值,约两兆字节的内部状态信息。
然后,它从大约15万词的词表中挑出一个token输出。
17个比特离开模型,两兆字节被丢弃,不会再被使用。
目前所有让多个模型协作的系统,包括编程子智能体、模型委员会、路由调度,全部建立在这17个比特之上。
来源说明
本站展示来自正式来源同步的内容摘录与本地观察,不默认跳转外网;需要核验上下文时可查看来源记录。