就在近期,Anthropic首次详细介绍了Claude在下一代AI研发中的进展。截至8月份,Claude已主导了约26%的AI研发工作,相比于今年2月的不足1%有了显著增长。同时,约3万个AI代理人在Anthropic的内部平台上从事研究和工程工作。今年8月,它们共做出了超过10亿次决策,其中约0.002%被实时监控系统拦截,显示出每4.7万次决策中才会触发一次阻止机制。此外,Anthropic还透露,用于AI研发的算力中有6%用于安全研究,在AI驱动的开发算力中,这一比例为12%。这一现象引发了一个问题:当AI开始参与AI的研发时,人类能否及时跟进并干预其行动?
为了评估Claude在研发中的贡献程度,Anthropic建立了「Anthropic研发自动化指数」的原型系统。这一指数利用Epoch AI提出的自动化等级,分为AL0至AL5六个级别。其中,AL0表示没有AI参与,AL3表示AI需在工程师密切指导下完成任务,而AL4表示AI在高层目标下可以独立完成大部分任务,仅在关键时刻接受人类监督。目前,Claude主导的26%研发工作属AL4级别。
以夜间数据管道故障为例,在AL3阶段,工程师需审核日志并提供指导,而在AL4阶段,工程师仅需将故障信息交给Claude,后者能够自主分析、寻找问题并测试修复方案。完成后,Claude会整理结果,由工程师决定是否进行部署。尽管如此,截至8月,Anthropic尚未发现任何AI研发工作达到AL5级别,Claude仍不能完全自主监控所有故障。 球友会
为建立该指数,Anthropic于7月每周随机抽取约20%的相关员工,让Claude分析他们在Slack和内部文档中记录的工作,最终整理出约1.5万项具体研发任务,并将其组织为542个节点的层级结构。这表明Claude在内部研发中的角色已从单纯的工具转变为可以独立完成任务的参与者。
随着研发自动化的提升,Anthropic还面临新挑战。当3万个Agent同时运行并互相协作时,传统的人工审查管理方式难以覆盖所有行为。因此,Anthropic部署了实时和事后监控系统。实时监控会在Agent执行操作前检查,以阻止可能迅速造成严重后果的行为。研究和工程Agent在8月做出了超过10亿次决策,其中约0.002%被实时监控阻止。之后的事后监控系统会分析Agent的活动,以识别潜在风险。系统每周大约标记10万份对话记录,筛选出有可能存在问题的行为。