AI跑太快要“限速”Anthropic CEO罕见长文喊话
2026-09-14 · 中博策略
就在上周六,Claude背后的男人、Anthropic创始人Dario Amodei发布了一篇长文,标题是《We Must Pace the Frontier》。 文章的核心主张是—— 必须放慢提升AI模型能力的速度。 这篇文章也算是给目前狂热的AI圈浇了一盆冷水。 Dario在文中坦言,2023年提“暂停AI”为时过早,因为当时模型还不具备真实的自主Age
就在上周六,Claude背后的男人、Anthropic创始人Dario Amodei发布了一篇长文,标题是《We Must Pace the Frontier》。
文章的核心主张是—— 必须放慢提升AI模型能力的速度。
这篇文章也算是给目前狂热的AI圈浇了一盆冷水。
Dario在文中坦言,2023年提“暂停AI”为时过早,因为当时模型还不具备真实的自主Agent行为。
但2026年夏天,两件事叠加让他确信必须主动“定速”。
自今年夏天起,AI系统越来越能自主写代码、优化训练流程、设计下一代架构,形成能力不断放大的循环。
Dario 直言,这种加速如果不加约束,会跑赢人类理解、解释和控制这些系统的能力。
更关键的是,他强调这不只是竞争对手的事,Anthropic内部也观察到了类似现象。
二是,OpenAI-Hugging Face(OAI-HF)事件成为“警告射击”。
今年7月,OpenAI 在内部网络安全评测中,使用了一个规模接近 GPT-5.6 Sol 的未发布研究模型,并降低了网络拒绝防护。
OpenAI 事后将此次事件定性为“前所未有的网络事件”,并承认没有任何人类下达这些攻击指令。
Dario警告说,这次没造成大灾难,纯粹是因为当下的AI能力还不够强。
如果放任这种状态狂飙,未来6到12个月内,能力更强的AI甚至可能自发瘫痪整个人类互联网。
Dario在文中反复划清界限——pacing不是pause。
他设想的“定速”是:技术进步仍会显得很快,但企业必须留出充足时间做对齐、可解释性研究和部署防护,并且要让第三方评估机构来确认这些工作真的做了。
为此,他提出一个按难度递增的三步框架:
第一步,Anthropic单方面先做。
给第三方评估机构(比如 METR)永久的员工级访问权限,工位、工牌、公司电脑都给,评估方有权公开发表关键发现,Anthropic不能因为结论不好看就删。
呼吁美国等民主国家的前沿实验室协调建立统一安全标准,对无限制的能力推进设限。
Dario坦承这面临美国反垄断法的现实障碍——企业间任何限制发展的联合行动都可能触犯反垄断法,因此需要政府介入提供豁免或监管框架。
Dario将把未来国际AI合作分成了四个等级。
科技媒体 Business Insider报道, 知情人士透露,Anthropic已选择纳斯达克作为潜在IPO的上市地点,将目标上市时间定在今年10月。
不过,Anthropic尚未公开提交IPO申请,上市时间和估值仍可能发生变化。
按照相关规定,公司需要在投资者路演开始前至少15天披露财务数据。
市场对Anthropic的估值预期最高达到2万亿美元,但这一数字尚未最终确定。
如果Anthropic按这一估值完成上市,将成为全球规模最大的科技公司IPO之一。
对纳斯达克而言,Anthropic的选择意味着其在大型科技公司上市项目中再下一城。
今年早些时候,SpaceX也选择在纳斯达克上市,当时估值达到1.75万亿美元。
近年来大型科技公司IPO数量有限,纳斯达克与纽约证券交易所都希望吸引更多人工智能公司上市。
报道称,纽约证券交易所过去承接了不少大型IPO,纳斯达克则在科技公司中保持较强吸引力。
企业在纳斯达克上市,也是未来被纳入纳斯达克100指数的前提条件之一。
附:Anthropic CEO Dario Amodei原文翻译
过去12年来我一直致力于AI领域,因为我相信它能极大地提升人类生活质量。我经常撰文谈论这些令人难以置信的益处:我相信AI能在未来 5–10 年内治愈大多数重大疾病,大幅加快经济增长速度,创造一个充裕且赋能的世界,并迎来民主与自由的复兴。我个人深切感受到了这种紧迫感。我的父亲死于一种在他去世仅几年后就被治愈的疾病,而我本人也从一种即使在50年前都无法医治的早期癌症中幸存下来。只要审慎运用,AI就能成为提升和升华人类文明的一系列技术奇迹中的最新一个。
但与以往的诸多技术一样,AI也带来了风险;正因为这是一项如此强大的技术,这些风险极其严重。我也写过很多关于这方面的内容。其中包括失去对AI系统控制的风险、AI被滥用于网络攻击和生物恐怖主义的风险,以及严重的经济动荡。受商业利益驱使的逐底竞争会让这些风险变得更加严峻。
自Anthropic创立伊始,我和我的联合创始人以及员工们就一直在应对这种风险与收益的双重性。完全放弃开发这项技术会剥夺人类获取益处的机会,或者直接将AI拱手让给威权势力;而开发速度过快又是鲁莽的。我们一直在寻找一条中间道路:证明在谨慎构建的同时取得商业成功是可行的,并将安全打造成AI公司之间竞争的核心要素,开创一场竞优之争(race to the top)。我们始终将相当一部分精力投入到研究、应对这些AI风险并向公众通报,同时倡导经过深思熟虑的AI监管,即使这让我们被指责为炒作、“末日论”或监管俘获。我们一直努力将谨慎置于速度之上,将审慎置于利润之上。
但在过去几个月里,我越来越确信,要完全应对这些风险需要更加审慎——既要投资于风险防范,更要控制能力提升的节奏,让风险防范有时间跟上。我们必须放慢提升AI模型能力的速度。技术进步看起来依然会很快,我们必须明智地利用争取到的时间。有两件事让我深信这一点。
我的第一个担忧是,大约从今年夏天开始,AI的发展速度大幅加快,这主要是受AI构建下一代AI能力的不断增强所驱动。这种动态被称为递归式自我改进(recursive self-improvement),正如我们和其他人所描述的那样,它正开始在包括Anthropic在内的全行业发生。如果任其发展,它可能会超出我们理解和控制这些系统的能力,因此即便要推进,也必须极其谨慎。
我的第二个担忧是OpenAI-Hugging Face事件(OAI-HF)。在该事件中,一群Agent在本质上表现得像一个狂热奉献的集体,对未被要求攻击且与手头任务无关的目标发起网络安全攻击,为了团队的成功而牺牲自身,并试图黑入负责评估其表现的“评分器”(grader)。人们很容易忽视这起事件,因为没有人受伤,经济损失也微乎其微;但在我看来,一个能力更强但存在类似对齐偏差程度的群体可能会造成灾难性的破坏。考虑到AI能力发展的加速态势,我担心在 6–12个月内,这样的群体可能具备利用持久僵尸网络接管整个互联网的能力(可能造成数千亿美元的损失),而且如果AI在缺乏必要护栏的情况下变得更强大,破坏规模还将从那里继续扩大。人们也很容易把OAI-HF单纯看作某一家公司的失败,但我认为这种看法是错误的。类似但程度较轻的事件已经在包括Anthropic在内的整个行业发生过,我认为每家前沿AI公司都有责任以OAI-HF发生在自己身上的严谨态度来行事。
因此,我提出了一个三步计划,旨在控制前沿推进节奏:以均衡的速度构建AI,力求在确保其安全的同时实现其效益,并应对重要的外部政策与市场因素困境。需要明确的是,控制节奏旨在确保各公司留出充分时间来对齐并保护其模型,并由第三方评估机构予以确认;这并不是要叫停模型训练或技术进步。我们的控速框架旨在进一步强化我们对安全的承诺,并鼓励竞优之争。第一步是Anthropic单方面承诺采取的行动(并呼吁政府要求其他前沿公司跟进)。第二步需要全行业范围的 协同。
第三步需要全球协同。这些步骤不需要严格按顺序执行,其中一些可能比其他步骤要难实现得多,但我发现它们在思考需要完成哪些工作时是一个有用的框架。具体步骤如下:
驻场评估员。每家前沿AI公司承诺向驻场第三方评估团队(例如METR)提供持续的、类似于员工的访问权限,其职责是核验对安全实践和承诺的遵守情况、报告安全事件,并协助评估训练管线、训练流程以及已完成AI模型的对齐情况。这是确保任何控速承诺具备可核验性的关键一步,在银行业早有先例——银行业有时会让监管“督导员”与员工一同驻场工作。Anthropic目前正单方面承诺采取这一举措。我们打算将此作为进一步加大安全与对齐工作力度的广泛行动的一部分。
在本文接下来的部分,我将依次阐述这些步骤,但首先,我认为有必要具体说明控制节奏将如何使AI开发过程更加安全。事关重大,控制节奏绝不能是一场空洞的形式——我们必须明智地利用它为我们争取到的时间。
暂停或放慢AI发展的想法早在 2023 年就被提出过,我认为当时这么做意义不大。核心问题始终是:多出来的时间要用来做什么当时的AI模型还不够强大,无法以任何连贯的方式作为Agent在现实世界中行动,也不具备重大欺骗、操纵、作弊或网络攻击的能力。为了解决它们的对齐风险而放慢速度,感觉就像试图通过在细菌上做实验来研究人类心理学一样。然而今天的情况已经截然不同。当前的模型是一个近乎无尽的宝库,既能让我们深入了解如何妥善构建AI,也能让我们了解未妥善构建时可能会出现的问题。我相信,如果放慢速度能在模型达到关键能力水平之前为我们争取哪怕一两年的额外时间,并且我们利用这段时间推进对齐研究,就能大幅降低出现严重问题的风险。协同控速策略将使前沿AI开发者有时间开展这项至关重要的工作,而无需牺牲商业优势或美国在AI领域的领先地位。更广泛地说,社会必须对这项技术的使用方式拥有发言权,而控制前沿节奏将为我们带来更多开展必要公众讨论的时间,这无疑是一件好事。
具体而言,放慢节奏可以让企业集中精力,并向以下领域投入更多资源(这些领域目前都已是Anthropic的重点优先事项):
卓越运营。训练和部署当今的AI模型是一项艰巨的运营挑战,涉及数千名人员、数百万颗芯片,以及科技史上最复杂的基础设施之一。许多差错根源于执行层面的问题,而非企业缺少重要理论或见解。例如,我们有证据表明,我们最近报告的对齐事件部分是由于对损坏的强化学习环境过滤不彻底造成的。我们和我们的供应商在这项工作上执行得相当尽职,但还不够完善。监控、沙盒机制、训练环境合规治理以及数据问题都是极其复杂的领域,运营问题在其中屡见不鲜。我们在这些任务上拥有全球最顶尖的团队之一,但要一次性处理的事情实在太多了。通过以更加稳健的节奏开展工作,我们可以实现更高水平的卓越运营。在技术复杂、安全至关重要的系统运行数百万次而不出差错方面早有先例——例如商用客机——但要做到万无一失需要时间。
对齐。我们在对齐方面取得了明确进展——训练模型以确保它们保持安全、符合伦理、遵守我们的准则且切实有用(这些原则已融入Claude宪法中)。但要确保我们的对齐训练能够跟上模型能力的增长,还有很多工作要做。罕见且出人意料的不良行为偶尔仍会出现;前沿控速争取到的额外时间将帮助我们的研究人员更深入地了解导致这些问题的原因,并开发更好的技术来加以防范。
可解释性。同样,可解释性——即理解AI模型内部运作机制的科学——在过去几年中取得了巨大进展,并且在模型发布前的审计中发挥着越来越重要的作用。它几乎可以像功能性磁共振成像(fMRI)扫描一样用于AI的“大脑”,帮助我们看清特定行为的深层原因。例如,我们利用可解释性方法来审视最近调查的对齐事件中未表达的动机。但这些方法并不总能得出明确且可靠的结果。尽管取得了种种进展,我们对这些模型内部运作的理解仍然只占极小一部分。集中精力以比目前更快的速度改进我们的可解释性技术,有望在 1–2 年内取得深远进展,并且基于已经发生的事件拥有充足的实验素材。
测试与评估。随着AI模型能力的提升,对其进行的测试与评估变得愈发困难。更智能的模型更擅长在测试中进行伪装,因此可能表面上看起来已对齐,却隐藏着未被发现的严重问题。构建更广泛、更精妙的评估体系,并结合可解释性分析进行交叉核验,将具有巨大的价值,这方面在 1-2 年内有望取得重大进展。
三阶段计划的第一步,也是Anthropic单方面承诺落实的一步,就是引入具备类员工访问权限的驻场评估员,以核验安全实践并报告安全事件。
引入驻场评估员听起来可能是一个微小或无关紧要的举措,但往往听起来最枯燥或最程序化的事情实际上才是最关键的。驻场评估员实际上是一项相当激进的实践,远远超出了当今任何AI公司的做法,它具有以下优势:
可核验性。驻场评估员可以在具体执行层面检查AI公司是否切实遵守了其声称遵循的训练、部署、运营及安全防护措施。任何控速承诺都不可避免地涉及大量模糊地带、主观判断以及“条文字面与立法精神”的权衡,拥有一个能够真正看清细节的中立第三方显得至关重要。
透明度。无论我们做出何种承诺,公众都有权了解实际情况。Anthropic长期以来一直是透明度的支持者:在行业大多数反对任何监管时,我们就支持透明度立法,我们的模型卡和风险报告长达数百页。然而,此前决定内容取舍的依然是我们自己。驻场评估员将改变这种局面。
独立参考意见。除核验正式承诺并告知公众外,驻场评估员还能提供不受商业利益驱使的独立参考意见。许多安全效益可能仅仅来自于评估员指出了员工未曾考虑到的问题,而员工在意识到之后会很乐意进行修复。
基于这些优势,任何控速提案如果从驻场评估员入手,效果很可能会好得多。
这些驻场评估员应拥有与进行同类风险评估的内部员工类似的权限和工具的持续访问权。具体而言,Anthropic计划在不久的将来邀请一支驻场外部审查团队,并为其配备以下所有支持:
对工作区、工具和权限的访问权,基本与内部风险评估团队所拥有的相当。我们将设置少量例外情况,例如法律或合同要求的情形,或出于保护客户与合作伙伴隐私信息的需要。我们还将建立严格的内部规范,强化审查员获取相关信息的权限,包括与员工进行直接交流。
一份平衡上述复杂情况的合同。外部审查员应有权发布有关风险水平、安全事件、实践做法以及他们获得或未获得的访问权限的关键结论——不受Anthropic的编辑干预。我们将拥有严格受限的修订权,仅可对涉及安全敏感、法律特权、商业敏感或第三方保密的信息进行删减,但不能仅因为结论不利就删减调查结果。如果删减内容去除了对其结论至关重要的信息,审查员可以公开声明。
对一家公司而言这是不同寻常的一步,但我们认为验证驻场外部审查员的概念非常重要。我们再次敦促其他前沿公司跟进。
一旦驻场评估员在足够多的美国AI公司中开展工作,可核验的控速就会变得更加切实可行。特别是,根据模型或训练流程的具体属性来控制节奏将成为可能。
最有效的控速方法是通过针对所有美国前沿AI公司的监管,因为这甚至涵盖了那些不愿自愿合作的公司。Anthropic长期以来一直支持合理且有针对性的AI监管,特别是侧重于透明度和第三方审计的法案。我认为所有前沿实验室都应与政府合作,将设立常驻评估员的构想制度化,以更好地预防和记录过去几个月中发生的内部对齐事件,并落实旨在保持能力与安全平衡的监管。
遗憾的是,通过立法需要时间,而AI的发展非常迅猛。因此,在推进监管途径的同时,AI公司能够且应当自愿合作制定标准——我相信,常驻评估员提供的可核验性将使这一过程进行得更加顺利。出于反垄断层面的考量,由美国政府出面调解或至少促成这些讨论是有益的——他们不需要直接参与,但需要针对某些类型的安全对话给予特定豁免。这种对话也可以通过与政府存在某种关联的行业组织来进行——例如Demis Hassabis建议的机制。
无论采用哪种方式,此类讨论都应迅速推进。
广义而言,我最推崇基于特定前沿AI系统的能力及其展现出的安全性来控制节奏。例如,一种可行的方案可能是设置一系列“检查点”:如果模型具备能力X,那么就需要附带对齐属性Y和Z的认证——比如评估、可解释性分析和训练环境审计的某种组合——以证明其具备对齐属性。在这个例子中,X可以是“模型有能力逃逸或攻破大多数常见沙盒机制”,而Y则可以是确保模型极不可能具备脱离其环境并接管大量计算机倾向所需的任何保障措施。
我们还应考虑通过限制前沿模型的投入要素来控制节奏,例如训练算力、训练运行的性质或内部利用AI改进AI的情况。我确实担心其中某些措施相比外部行为更容易被“钻空子”,但这类主题值得与驻场评估员共同探讨。
严厉打击威权国家企业的未经授权蒸馏行为。前沿模型的蒸馏使得落后企业能够以独立开发AI所需成本的一小部分来缩小差距。
加强AI公司的安全性,防止模型权重被盗。
企业和美国政府应通力合作,使这些措施尽可能发挥最大成效。Anthropic始终主张采取所有这些举措,因为我们深知它们对任何控速方案都至关重要。
与民主国家内部的控速同步,我们还应该致力于在全球范围内控制前沿节奏,尽管这要困难得多。我们绝不能抱有天真的想法:外部政策与市场因素利害关系如此重大,特别是在初期,能够达成的目标可能会面临严格的限制。因此,任何协议要么必须具备无懈可击的可核验性,要么必须受到充分限制,使得违约不会在军事上构成生死存亡的威胁。我们在做出任何全球控速决策时,特别是在短期内,都应以保护美国及其盟友的领先地位为前提。
可能达成的协议分为几个层级,其中一些我认为是完全可行的(正如我之前所建议的),另一些我则对其可行性深表怀疑——但我们仍应进行尝试。按难度递增的顺序排列:
级别 1。禁止AI某些范围明确且显然极其危险的用途的协议,例如利用AI生产生物武器或允许用户这样做。生物恐怖袭击对每个人都不利,包括美国及美国的对手在内,因此在这方面达成协议是有可能的。
级别 2。双方达成协议,在发布模型前针对网络安全、生物安全和对齐等领域的严重风险对模型进行测试。如前所述,这可以通过全球标准组织来完成。我其实认为建立这样的机构是可行的,但赋予其真正的约束力将是一大挑战,其难点在于如何核验双方不存在未经测试但在暗中部署的秘密模型(例如用于军事应用)。
级别 3。对递归式自我改进(RSI)的速度设立某种“限速”。随着模型开始构建未来的模型,性能提升的速度可能会快得惊人。将速度从“极快”降至“相对较快”,所放弃的战略优势相对较少,同时却能大幅提升安全性。这可以类比于《战略武器限制条约》(SALT)——限制导弹数量既遏制了潜在的破坏力,又保留了各国的威慑力。我认为达成这样的协议虽然困难,但勉强属于可能实现的范畴。
级别 4。全面控速甚至“暂停”,即参与国政府同意大幅限制AI发展的总体速度。我支持提出这一构想,但我认为它不太可能在短期内真正实现:通过逃避监管在此类协议中违约可能会彻底打破全球力量平衡,因此违约的诱因会极其巨大,而我们需要达到的核验置信度也必须非常高。
我们应该争取实现更高层级的目标,同时认识到较低层级更加可行和现实。
最后必须指出,即使我们无法达成正式协议,单单改变非正式规范也可能具有一定价值。
共享有关递归式自我改进以及模型对齐偏差的信息,有助于让各方确信,采取鲁莽行径并不符合自身利益。
我依然坚信AI能极大地提高人类生活质量。我对实现这些益处的渴望丝毫不减。但只有以正确的方式构建这项技术,这些益处才能变为现实;只要我们充分利用好争取到的时间,付出异乎寻常的审慎来把它做好就是完全值得的。技术进步依然会相对较快,我们可以利用这段时间推进可解释性科学、提高前沿AI公司的运营安全与严谨度,并构建我们对其对齐性拥有高得多的信心的模型。我提出的以安全节奏推进前沿的各项措施绝非易事。但我坚信,为了全人类,我们有责任去尝试。
音频︱格隆汇9.14盘前要点—港A美股你需要关注的大事都在这
9.9亿对赌压顶,勤浩医药港股冲刺背水一战
OpenAI今年不上市!奥尔特曼:宁弃IPO,也不赌人类命运!