Anthropic公布论文《自动化研究员能够可靠缓解对齐失效》,尝试让AI系统研究并改进其他模型的对齐训练。研究团队设置10种具体失调行为,自动化系统最终让10项指标全部改善,同时没有降低模型整体能力。
项目由Anthropic研究员计划成员陈岳翰领导。自动化系统先阅读已有文献,再提出训练方法,按方案训练模型30分钟,并通过多轮实验比较结果,保留有效方法、淘汰无效方法。
这套流程模仿研究人员从资料、假设到实验评估的工作顺序,但可并行扩大尝试数量。论文把它称为自动化对齐研究员AAR,目标不是生成一段答案,而是寻找能在基准上稳定改善模型的方法。
实验中表现最好的AAR方法平均用6小时,就超过经验丰富的人类研究人员提出的方案。论文还称,人类引导研究方向没有带来更强结果,这一结论限定在本次任务与基准集合内。
成本比较同样具体。AAR每小时API推理费用约4美元,研究项目支付给人类研究人员的费用为每小时150美元。两者衡量的是实验执行成本,不包括建立模型、算力基础设施和设计基准的全部投入。
研究意义在于AI可以参与训练方法改进,而不只执行固定训练脚本。若系统能优化对齐后训练,未来也可能探索更广泛的训练流程,这被视为递归自我改进方向的一步。
论文同时强调限制。系统是否真正改善对齐,首先取决于基准能否代表真实目标;如果测试指标遗漏重要行为,自动化研究员可能只擅长提高分数,而没有解决实际问题。
建立和长期维护基准仍需要大量工作,供AAR阅读的研究文献也要持续更新。自动化系统的低单次试验成本,不能消除人类在定义问题、审查目标和判断外部有效性方面的责任。
因此,这项结果证明的是自动化对齐后训练在10项测试上的可行性,不是AI已能独立完成所有研究。6小时、4美元每小时与10项改善提供量化优势,基准质量和知识维护则决定方法能否扩展。
自动系统每轮训练模型30分钟,再以多轮筛选扩大实验。6小时超过人类方案并不意味着只做一次尝试,而是提出方案、训练、评估和淘汰形成循环。若基准设计偏差,这个循环也会更快地优化错误目标,因此论文把基准维护列为核心限制。
人类研究人员在本实验中的每小时费用为150美元,AAR约4美元,两项相差明显。但前者包含研究者劳动,后者只是API推理成本,比较适合说明执行实验的边际费用,不能视为完整科研项目总成本。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。