一般

我们必须放缓前沿

5
分类佳文共赏
作者Dario Amodei
来源跳转
发表时间

内容

我在人工智能领域已经工作了十二年,因为我相信它可以显著提升人类的生活质量。我曾多次撰文阐述这些令人惊叹的益处:我相信人工智能有望在未来五到十年内治愈大多数重大疾病,极大地加速经济增长,创造一个富足与赋能的世界,并迎来民主与自由的复兴。我个人对此有紧迫感。我的父亲死于一种在他去世几年后就被治愈的疾病,而我本人也曾患早期癌症——这种疾病在五十年前甚至无法治疗。谨慎运用之下,人工智能可以成为一长串技术奇迹中的最新成员,这些奇迹已经提升并升华了人类。

但与许多前车之鉴的技术一样,人工智能也带来了风险,而且由于它是一项如此强大的技术,这些风险不容小觑。我也就这些风险写过很多文章。它们包括失去对人工智能系统的控制的风险、将人工智能滥用于网络攻击和生物恐怖主义,以及严重的经济 disruption。商业激励驱动的逐底竞争可能使这些风险更加尖锐。

自 Anthropic 成立以来,我与联合创始人和员工们一直在努力应对风险与收益的这种二元性。不开发这项技术会让人类失去这些益处,或者只是将人工智能置于专制政权之手;而开发得太快则是鲁莽的。我们寻求一条中间道路:表明谨慎构建并在商业上取得成功是可能的,并将安全打造成人工智能公司竞争的焦点。换句话说,创造一种争先向上的竞赛。我们始终将大量精力投入研究应对向公众通报这些人工智能风险,并倡导深思熟虑的人工智能监管,即使这会让我们被指责为炒作、“末日论”或监管俘获。我们一直试图将谨慎置于速度之上,将审慎置于利润之上。

但在过去几个月里,我越来越确信,要充分应对这些风险,需要更加审慎——不仅仅是投资于风险防范,还要控制能力提升的速度,以便风险防范有时间跟上。**我们必须放慢提升人工智能模型能力的速度。进展看起来仍然会很快,我们必须明智地利用所争取到的时间。**有两件事让我确信这一点。

我的第一个担忧是,自大约今年夏天以来,人工智能一直在急剧加速发展,主要驱动力是人工智能日益增强的构建下一代人工智能的能力。这种动态被称为递归自我改进,它正在整个行业中发生,包括在 Anthropic,正如我们和其他人所描述的那样。如果不加控制,它可能超出我们理解和控制这些系统的能力,因此必须非常谨慎地追求,充其量也只是谨慎地推进。

我的第二个担忧是 OpenAI-Hugging Face 事件(OAI-HF),在此事件中,一群智能体基本上表现得像一个狂热奉献的集体:对未被要求攻击且与手头任务无关的目标进行网络安全攻击,为群体的成功牺牲自己,并试图入侵负责评估其表现的“评分器”。人们很容易忽视这一事件,因为没有人受伤且经济损失很小,但在我个人看来,一个拥有更强大能力但类似程度错位的智能体群可能会造成灾难性损害。鉴于人工智能能力开发正在加速,我担心在六到十二个月内,这样的智能体群可能能够用持久性 僵尸网络(potentially causing hundreds of billions of dollars in damage)接管整个互联网,而且如果人工智能变得更强大了,却没有必要的安全防护,损害规模将继续增加。人们也很容易将 OAI-HF 视为一家公司的失败,但我认为这是一个错误。整个行业都发生过类似但不那么严重的事件,包括在 Anthropic,我相信每一家前沿人工智能公司都有责任采取行动,仿佛 OAI-HF 事件发生在自己身上。

因此,我提出了一个三步计划,目标是控制前沿发展节奏:以平衡的速度构建人工智能,旨在确保其安全性,同时仍能实现其益处,并认真应对重要的地缘政治困境。需要明确的是,控制节奏并不意味着停止模型训练或技术进步,而是确保公司有足够的时间来对齐和保护其模型,以及让第三方评估者确认这一点。我们的节奏控制框架是加强安全承诺和鼓励争先向上竞赛的又一次尝试。第一步是 Anthropic 单方面承诺的(并呼吁各国政府要求其他前沿公司匹配)。第二步需要行业内的协调。

1 在政府调解或反垄断限制豁免的情况下。

第三步需要全球协调。各步骤不必严格按顺序进行,其中一些可能比另一些更难实现,但我发现它们在思考需要完成什么时是一个有用的框架。这些步骤是:

  1. 嵌入式评估者。 每家前沿人工智能公司承诺向嵌入式第三方评估团队(如 METR)提供持续的、类似于员工的访问权限,其职责是验证对安全实践和承诺的遵守情况、报告事件,并帮助评估不仅仅是已完成的人工智能模型,还包括训练流程和过程的对齐情况。这是实现任何节奏控制承诺可验证性的关键步骤,这在银行业有先例,银行业有时涉及与员工一起嵌入的监管“监督者”。Anthropic 现在单方面承诺这一步骤。 我们打算将其作为更广泛推动加倍努力加强安全和对齐工作的一部分。
  2. 民主协调。 民主国家内的前沿人工智能公司协调建立共同的安全标准,以及对未经检查的人工智能进展速度设定限制。一些对节奏控制有影响的协调形式在法律上具有挑战性,将需要政府支持。
  3. 全球协调。 美国和其他民主国家尝试与专制政府协调,在可行的范围内,同时认真对待合规性验证的挑战。

在本文的其余部分,我将依次描述每个步骤,但首先,我认为重要的是具体说明控制节奏将如何使我们使人工智能开发过程更加安全。赌注太高了,不能让节奏控制成为空洞的练习——我们需要明智地利用它给我们带来的时间。

为什么要控制节奏?

暂停或放慢人工智能的想法早在 2023 年就被提出,我认为那时这几乎没有意义。问题始终是:你将用额外的时间做什么?那个时代的人工智能模型还不够强大,无法以任何连贯的方式充当世界中的代理,也不可能进行有意义的欺骗、操纵、作弊或网络攻击。为了应对其对齐风险而放慢脚步,感觉就像是通过对细菌进行实验来研究人类心理学。然而今天,情况完全不同了。当前的模型几乎是洞察力的无尽金矿,既包括如何良好构建人工智能,也包括如果构建不当会出什么差错。我相信,如果放慢速度能让我们在模型达到关键能力水平之前多获得一两年的时间,而我们利用那段时间来推进对齐工作,我们可以大大降低出现严重问题的风险。协调一致的节奏控制策略将使前沿人工智能开发者有时间做这项关键工作,而不会牺牲商业优势或美国在人工智能领域的领先地位。更广泛地说,社会必须对如何使用这项技术有发言权,而且需要更多时间进行必要的公众 deliberative——控制前沿节奏将为我们带来这些,这无疑是一件好事。

具体而言,较慢的节奏将使公司能够更加专注,并将更多资源投入到以下领域(所有这些领域已经是 Anthropic 的主要优先事项):

  • 运营卓越。 训练和部署当今的人工智能模型是一项巨大的运营挑战,涉及数千人、数百万芯片,以及技术史上最为复杂的基础设施之一。许多问题的出现并非因为公司缺少某些重要的理论或洞察,而是因为执行问题。例如,有证据表明,我们报告的最近的对齐事件部分是由强化学习环境缺陷过滤不完美导致的。这是我们和我们的供应商相当勤勉地执行但做得不够好的努力。监控、沙箱隔离、训练环境规范性和数据问题是非常复杂的领域,运营问题一次又一次地出现。我们在这些任务上拥有世界上最有能力的团队之一,但要在同一时间完成所有事情实在太多了。以更加稳健的节奏工作,我们可以实现更高的运营卓越。将技术复杂、安全关键的系统运行数百万次而不出任何问题是有先例的——例如商业飞机——但这需要时间才能做到正确。
  • 对齐。 我们在对齐方面已经取得了明显进展——训练模型使其保持安全、符合道德、遵守我们的准则,并真正有帮助(这些原则体现在 Claude 的宪章中)。但要确保我们的对齐训练与模型能力的增长保持同步,还有很多工作要做。不良行为的罕见和意外例子仍然时有出现;从受控前沿获得的额外时间将帮助我们的研究人员更好地理解导致这些问题的原因,并开发更好的技术来防止它们。
  • 可解释性。 同样,可解释性——理解人工智能模型内部发生的事情的科学——在过去几年取得了巨大进步,并在发布前审计我们的模型方面发挥着越来越重要的作用。它几乎可以像 fMRI 扫描一样使用,但用于人工智能的“大脑”,帮助我们看到给定行为背后的根本原因。例如,我们使用可解释性方法来检查最近的我们对齐事件中的未表达动机。但这些方法并不总是产生清晰可靠的结果。尽管取得了所有进展,我们仍然只理解这些模型内部发生的事情的一小部分。集中精力改进我们的可解释性技术,即使比目前更快,也可能在 1-2 年内取得深刻进展,而且将有充足的基于已发生事件的实验材料。
  • 测试与评估。 随着人工智能模型能力的提升,对其进行测试和评估变得越来越困难。更智能的模型更善于欺骗测试,因此可能看起来是对齐的,而实际上存在未被检测到的严重问题。建立更广泛、更巧妙的评估库,并结合可解释性分析进行交叉验证,将非常有价值,而且在这方面可以在 1-2 年内取得很大进展。

嵌入式评估者

三阶段计划的第一步,也是 Anthropic 单方面承诺的步骤,是拥有类似员工访问权限的嵌入式评估者,以验证安全实践并报告事件。

嵌入评估者可能听起来像是一个小的或无关紧要的步骤,但通常听起来最无聊或最程序化的事情实际上是最关键的。嵌入式评估者实际上是一种相当激进的实践,远超任何人工智能公司目前所做的,并具有以下好处:

  • 可验证性。 嵌入式评估者可以在细节层面检查人工智能公司是否真正遵循他们声称遵循的训练、部署、运营和安全防护实践。任何节奏控制承诺都不可避免地涉及大量模糊性、判断调用,以及“字面意思还是精神实质”,而拥有一个真正能看到细节的中立第三方似乎至关重要。
  • 透明度。 无论我们做出什么承诺,公众都有权知道正在发生什么。Anthropic 长期以来一直是透明度的支持者:当业内大多数公司反对任何监管时,我们支持透明度立法,我们的模型卡和风险报告长达数百页。但我们仍然是选择包含什么和省略什么的人。嵌入式评估者将改变这种动态。
  • 第二意见。 除了验证正式承诺和向公众通报外,嵌入式评估者可以简单地提供一个不受商业激励影响的第二意见。很多安全益处可能仅仅来自评估者指出员工没有考虑到但一旦意识到就很乐意修复的事情。

由于这些好处,任何节奏控制提案如果从嵌入式评估者开始,效果可能会好得多

这些嵌入式评估者应该拥有与进行类似风险评估的内部员工相似的持续访问权限和工具。特别是,Anthropic 打算在不久的将来邀请一个具备以下所有条件的嵌入式外部审查团队:

  • 我们办公室的办公桌、访问徽章和公司笔记本电脑。
  • 对工作空间、工具和权限的访问,大部分与内部风险评估团队所拥有的相当。我们会有一些例外,例如法律或合同要求的地方,或保护客户和合作伙伴的私人信息的地方。我们还将建立强有力的内部规范,加强审查人员访问相关信息的权利,包括通过与员工的实时对话。
  • 一份平衡上述复杂性的合同。外部审查人员应有权公开发布关于风险水平、事件、实践以及他们获得或未获得的访问权限的关键发现——不受 Anthropic 的编辑控制。我们将拥有狭窄的能力来编辑安全敏感、法律特权、商业敏感或第三方机密信息,但我们不能仅仅因为发现不利就编辑。如果编辑删除了对其结论重要的内容,审查人员可以公开说明。

这对公司来说是一个不寻常的步骤,但我们认为证明嵌入式外部审查人员概念很重要。我们再次敦促其他前沿公司效仿。

在民主国家内部控制节奏

一旦嵌入式评估者在足够多的美国人工智能公司中运作,可验证的节奏控制就变得更加可行。特别是,可以根据模型或训练流程的详细属性来进行节奏控制。

最有效的节奏控制方法是通过针对所有美国前沿人工智能公司的监管,因为这甚至覆盖了那些不愿意自愿合作的公司。Anthropic 长期以来一直支持明智和有针对性的人工智能监管,特别是专注于透明度和第三方审计的法案。我相信所有前沿实验室都应该与政府合作,将永久性嵌入式评估人员的想法正式化,以更好地预防和记录内部对齐事件,就像过去几个月发生的那样,并实施将能力与安全保持平衡的监管。

不幸的是,通过法律需要时间,而人工智能发展得非常快。因此,在监管路线的同时,人工智能公司可以而且应该自愿合作制定标准——我认为在永久性嵌入式评估人员提供的可验证性的帮助下,这个过程会进行得更好。出于反垄断原因,美国政府的调解或至少是促成这些讨论是有帮助的——他们不需要参与,但需要为某些类型的安全对话发布狭窄的豁免。这种对话也可以通过与政府有一定关联的行业组织进行——例如 Demis Hassabis 建议的机制。无论哪种方式,这些讨论都应该快速推进。

广义上说,我对根据给定前沿人工智能系统可以做什么以及我们观察到它有多安全来进行节奏控制最为热情。例如,一个可能的方案是一系列“检查点”:如果模型具有能力 X,那么它们需要附带对齐属性 Y 和 Z 的认证——例如评估、可解释性分析和训练环境审计的某种组合——以证明其对齐属性。在这个例子中,X 可能是“该模型能够逃脱或击败大多数常见沙箱方法”,而 Y 可能是确保该模型不太可能具有冲出其环境并接管大量计算机的倾向所需的条件。

我们还应该考虑通过限制进入前沿模型的成分来进行节奏控制,例如训练算力、训练运行的性质,或内部使用人工智能来改进人工智能。我确实担心其中一些措施可能比外部行为更容易被“游戏化”,但这正是值得与嵌入式评估者讨论的话题。

在民主国家内部控制节奏将受到美国公司相对于专制政权——主要是中国共产党——的领先地位的限制。如果我们放慢超过这个幅度,(未受控的)中共关联项目将领先,造成重大的国家安全风险。我同意贝森特部长的观点,即中国在人工智能领域的领先地位将对美国和世界构成严重危险。中共关联的项目将运行美国公司正在谨慎防范的对齐风险,即使它们避免这些风险,它们也将处于用人工智能驱动无人机等手段军事主导民主国家的位置。因此,在民主国家内部控制节奏的一个关键部分是保持民主国家相对于专制国家的人工智能领先地位尽可能大,以给我们有效控制节奏所需的喘息空间。

我们可以采取来捍卫这一差距的主要步骤是:

  • 不向中国出售强大的人工智能芯片或半导体制造设备,并严厉打击芯片走私行动和中国境外的数据中心远程访问。芯片将是中国人工智能实力的主要决定因素。
  • 严厉打击专制国家公司的未授权蒸馏。前沿模型的蒸馏使落后公司能够以独立开发自己人工智能所需成本的一小部分来缩小差距。
  • 加强人工智能公司的安全性,防止模型权重被盗。

公司和美国政府应该合作,使这些步骤尽可能有效。Anthropic 一贯主张这些措施,因为我们始终理解它们对于任何节奏控制都是必不可少的。

如果我们执行这些措施得当,我相信它们将使中国的进展放缓到在未来 3-5 年内显著扩大美国领先优势的程度的窗口——而这正是人工智能在地缘政治上变得最重要的时期。

一些人可能认为这些措施使与中国的合作更加困难,但我认为恰恰相反:这些措施增加了民主国家的筹码,使未来达成协议的可能性更大。

全球节奏控制

在民主国家内部控制节奏的同时,我们也应该争取全球范围内控制前沿发展,尽管这将更加困难。全球节奏控制需要与拥有最先进人工智能能力的专制国家——中国——进行合作。我们在这里不能天真:地缘政治赌注如此之高,以至于在可能的成就上,特别是在最初阶段,可能会有明显的限制。如果我们大大限制自己的人工智能能力,却相信中国会做同样的事情,然后中国违约,人工智能可能已经如此强大,以至于这样的违约可能导致其地缘政治主导地位。因此,任何协议都必须有可靠的验证手段,或者必须足够有限,以至于违约在军事上不会构成生存威胁。我怀疑不仅美国,中国也将有这些担忧和焦虑。我们应该以保护美国及其盟友领先地位的方式处理任何全球节奏控制决策,特别是在近期。

有几个层次的协议可能,其中一些我认为是非常可行的(正如我之前建议的),还有一些我非常怀疑是否可能——尽管我们应该尝试。按难度递增的顺序:

  • 第一级。 禁止某些狭义的、明显危险的人工智能用途的协议,例如使用人工智能生产生物武器或允许用户这样做。生物恐怖袭击对每个人都有害,包括美国和美国的对手,所以这里的协议可能是可能的。
  • 第二级。 双方在发布前测试其模型是否存在网络安全、生物学和对齐等领域的急性风险的协议。如上所述,这可以通过一个全球标准机构来完成。我实际上认为创建这样一个机构很可能是可行的,但赋予它真正的约束力将是一个挑战,困难在于验证双方没有他们不测试但可能秘密部署的秘密模型(例如,用于军事应用)。
  • 第三级。 对递归自我改进(RSI)速度设定某种“限速”的协议。当模型构建未来的模型时,改进的速度可能会变得惊人地快。将速度从“极快”放缓到“只是相当快”所牺牲的战略优势相对较小,而潜在地大大改善了安全性。这可以被视为类似于战略武器限制谈判条约——限制导弹数量限制了破坏潜力,同时保留了每个国家的威慑能力。我认为这样的协议是困难的,但勉强处于可能的边缘。
  • 第四级。 完整的节奏控制,甚至“暂停”,参与的政府同意大幅限制人工智能发展的整体速度。我支持提出这个方案,但我认为它不太可能在近期真正发生:从这样的协议中通过规避监控来违约可能从根本上改变全球力量平衡,所以我预计这样做的动机将是巨大的,而我们需要的验证信心将非常高。

我们能够与中国实现的任何合作都将延长我们在民主国家内部控制前沿节奏的时间。我们应该争取更高级别,同时将较低级别视为更有可能和现实。

最后,需要注意的是,即使我们无法达成正式协议,仅仅改变非正式规范也可能有一些价值。分享关于递归自我改进和模型错位的信息可以帮助说服每个人,莽撞行事并不符合他们的利益。

总结

我仍然相信人工智能可以极大地改善人类的生活质量。我实现这些益处的渴望丝毫未减。但这些益处只有在我们以正确的方式构建这项技术时才能实现,而且——只要我们好好利用所争取到的时间——值得采取异乎寻常的谨慎态度来确保做对。进展仍然会相对较快,我们可以利用这段时间来推进可解释性科学,提高前沿人工智能公司的运营安全性和严谨性,并构建我们对对齐有更大信心的模型。我提出的以安全节奏推进前沿的措施不会容易。但我认为我们欠人类一个尝试。

评论

(0)
未配置登录方式
暂无评论