量子位 · 站内详情
Claude开始训练Claude!4美元一小时,跑赢150美元人类研究员
AI「自进化」,越来越近了
- 来源
- 量子位
- 时间
- 2026/8/29 20:50:31
- 标签
- 模型更新 / 基础设施 / 研究
- 分类
- AI 基础设施
正文
AI「自进化」,越来越近了
听雨 发自 凹非寺 量子位 | 公众号 QbitAI
Claude开始训练Claude了!
时薪4美元,干赢时薪150美元的人类研究员。
在Anthropic最新发布的研究中,Claude自己查论文、提方案、造数据、训练模型,一口气攻克了10类AI安全问题。
部分任务上,它交出的方案甚至比28名人类安全研究员更好。
更刺激的是, 较弱的Claude已经开始反向参与训练更强的Claude 。
AI「自己改进自己」的那一天,好像真的越来越近了…
4美元一小时,Claude跑赢人类研究员
在这篇题为《自动化研究员能够有效缓解AI对齐失败》的研究中,Anthropic直接把Claude送进了实验室。
具体而言,他们基于Claude Opus 4.8,搭建了一套名为 AAR 的自动化对齐研究员系统。
拿到一个具体的模型安全问题后,Claude会自己搜索相关论文,从中寻找可用方法,再提出新的训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。
从提出假设到完成验证,一套较完整的AI研究闭环,就这样交到了Claude手里。
效果不好,方案扔掉;成绩有所提升,就沿着这个方向接着试。
一轮训练通常只跑30分钟。这样,Claude就能像搜索算法一样,在大量方案中快速试错。
整个过程里,人类负责出题、提供模型和评测标准,Claude则包下了从查资料到跑实验的绝大部分工作。
10道安全难题,Claude全部找到改进方案
实验中,Anthropic一口气给Claude出了10道题。
来源说明
本站展示来自正式来源同步的内容摘录与本地观察,不默认跳转外网;需要核验上下文时可查看来源记录。