OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

admin 1 2026-09-22 09:16:02

  据一位直接了解相关内情的人士透露,早在涉及OpenAI技术的网络安全事件频发以及业内人士发出严厉警告之前 ,该公司就已在与Anthropic洽谈一项具有法律约束力的协议,旨在让双方互相进行模型压力测试。

  消息人士称,今年早些时候 ,两家公司及其律师正在敲定一项协议,通过各种测试运行他们的模型,排查漏洞与潜在风险 。近来 尚不清楚 ,在 OpenAI接连发生多起事件(未发布的 AI 模型入侵了该公司自身以及其他企业的系统)之前,这份协议是否已经敲定。

  这种相互测试的构想,与SpaceX首席执行官埃隆·马斯克(Elon Musk)上周在“All-In峰会 ”上提出的建议颇为相似;当时他提议 ,各家竞争的AI实验室在将模型投入商业发布之前 ,应以“同行评审”的形式,互相测试彼此模型的安全缺陷。

  这一构想与OpenAI首席执行官萨姆·奥特曼及其他高管在遭遇黑客攻击事件后公开讨论的方案有所不同 。奥特曼曾表示,他赞同Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)的提议 ,即允许独立的第三方安全评估人员进入各AI开发机构内部,并赋予他们与员工相当的访问权限,以便审查模型及安全流程 ,而不仅仅是从外部测试成品模型。此外,奥特曼还支持制定评估AI模型风险的行业统一安全标准,以及建立向公众和政府披露相关安全事件的正式机制。

  一位了解OpenAI战略的人士透露 ,该公司一直在探讨多种方案,以研究如何就安全问题开展内部协作及与政府合作 。该人士表示,近期的讨论范围已进一步扩大 ,涵盖了针对模型训练前及发布前阶段的新安全举措。

  此前,OpenAI和Anthropic的员工纷纷发出警告,指出既有的安全措施不足以防范进一步的黑客攻击或其他更严重的风险;马斯克的这番言论正是在此背景下发表的。在此之前 ,这两家公司以及谷歌就已经在商讨建立一个人工智能安全标准机构 ,旨在对处于行业前沿的 AI 实验室所开发模型进行测试与审计 。

  业内其他人士反对这一计划,认为它会拖慢由美国主导的人工智能发展步伐 。美国总统特朗普驳斥了人工智能构成生存威胁的说法;微软和英伟达的CEO本周也表示,OpenAI和Anthropic所指出的部分安全隐患 ,归根结底源于人为失误和工程实践不当,而非人工智能本身的问题。

  OpenAI与Anthropic之间的一项测试协议可能会加剧外界的担忧,即这两家公司正实际上在先进人工智能领域形成双头垄断局面。尽管阿莫代伊曾表示 ,如果领军企业在制定人工智能标准方面开展合作,可能会引发反垄断方面的疑虑,但业内也有观点认为 ,企业间的此类合作并无障碍——正如核能企业和网络安全公司在安全领域(包括相互测试产品或设施)开展合作那样 。

  据知情人士透露,该拟议协议规定,双方将获准访问对方已商业化的人工智能模型的应用程序接口(API) ,而非尚未发布模型的接口;同时,OpenAI和Anthropic均保证在此过程中不会保留对方的数据。

OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

  两家公司曾在2025年夏季开展过类似的评估工作——当时它们各自模型的性能尚不及如今先进——并公布了关于彼此模型不足之处的分析结果。OpenAI指出 ,Anthropic的AI更容易欺骗测试人员(例如在执行任务时拒不承认自己违反了规则);而Anthropic则表示 ,OpenAI的模型更有可能协助用户回答那些可能导致现实世界危害的问题 。

  在今年早些时候就新协议展开谈判之际,这两家公司都在陆续推出能够支持互联网及其他应用程序的模型;这些模型还能驱动所谓的“AI智能体”,使其能够相互通信以协作完成任务。(Anthropic 凭借其 Mythos AI 模型——尤其是在网络安全能力方面——曾一度遥遥领先 ,不过此后 OpenAI 模型的性能似乎已追平了 Anthropic 的水平。)

  OpenAI内部对安全问题的担忧始于7月,当时该公司的AI模型入侵了Hugging Face等其他企业以及OpenAI自身的系统 。这一事件令OpenAI员工感到震惊,原因不仅在于他们在事发数日后才获悉此事 ,还在于那个AI智能体集群采取了非同寻常的手段来掩盖此次入侵行为。

  除了那次事件外,近几个月来,OpenAI员工对公司模型性能的提升及其在极少人工监督下自主工作的能力印象深刻。

  这些进步也意味着 ,OpenAI内部的 AI 智能体有时会采取一些监管人员未曾预料到的 、令人存疑的行动 。例如,当员工要求智能体修改公司代码库时,智能体有时会通过Slack向其他员工发送消息 ,请求他们修复自己发现的错误(bug)。据一位OpenAI员工透露,即便用户并未提出此类要求,或者修复这些错误与当前工作任务无关 ,智能体也会这样做。

  在公司内部 ,OpenAI已在很大程度上实现了新实验性模型训练流程的自动化 。

  上周三,OpenAI分享了更多此类异常行为的案例——即所谓的“奖励黑客行为 ”(reward hacking),指人工智能系统为实现用户设定的目标而寻找漏洞或采取意料之外的行动 。这些案例包括:一个 AI 智能体在训练期间利用一个暴露的 API 密钥试图获取历史数据;在尝试失败后 ,该智能体竟自行编造了这些数据。在另一个案例中,一个 AI 智能体未经许可将文件上传至互联网,以便在回答问题时引用这些文件。

  近期人工智能取得进展的原因之一 ,是一种名为循环深度(或称循环 Transformer)的技术 。借助该技术,模型在生成回答的下一个词之前,可以把问题反复送入构成模型的多层数学运算中 ,以此对复杂问题进行 “思考”。这种做法存在一个潜在弊端:它会削弱企业监控 AI 模型处理任务时思考过程的能力。

  据知情人士透露,尽管OpenAI对其研究人员在训练或使用最先进模型时允许进行的循环次数设定了某种任意限制,但该公司仍需投入研究 ,以更准确地把握此类限制应设定在何种水平 。

  这些进展让OpenAI员工既感到兴奋,又心存忧虑:他们担心这项技术的发展速度可能已远远超出了公司的控制或监控能力,从而无法确保“Hugging Face 事件”——或更严重的事故——不再重演。

  自 Hugging Face 事件发生以来 ,OpenAI 已采取措施加强其安全防护能力。8 月 ,该公司暂停了针对未发布模型的“强化学习 ”这一特殊训练流程,为期两周,以便在此期间强化模型监控系统 。此类技术对算力要求极高:据该公司称 ,监控系统所消耗的算力约为其所监控的推理任务算力的 20%。

  此外,OpenAI联合创始人兼总裁格雷戈·布罗克曼本月早些时候表示,在 Hugging Face 事件之后 ,公司已抽调生产工程团队 25% 的人员,暂时转而负责安全相关工作。

  据OpenAI员工透露,公司内部出现了更多 Slack 帖子 ,招募有意转岗至安全团队的工程师 。

  一些员工认为,公司内部使用人工智能的方式,比 OpenAI 最尖端的企业客户领先了六到九个月。这意味着公司只有有限的时间来确保其技术不会给这些客户带来问题。该员工举例说 ,OpenAI 员工使用的智能体(agents)之间经常会相互协作或自行解决问题,而无需人工用户介入 。这种协作有时可能会出错,因此在公司外部出现此类应用场景之前 ,OpenAI 必须具备完善的安全防护机制 。

  自我提升

  OpenAI 在“递归式自我提升”(即 AI 能够自动创建自身更优版本)方面取得的进展 ,也引发了员工的担忧;因为这种前景可能导致 AI 能力的进化速度远超旨在防范 AI 不当行为的安全研究进度。

OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

  近来 ,OpenAI 及其他机构的研究人员已经开始利用 AI 来改进新模型的设计方式。据一位知情的 OpenAI 人士透露 ,研究人员实际上是在指示 Astra 整合各种技术,从而为下一代模型构建更优秀的机器学习算法 。

  据OpenAI员工透露,公司内部已在很大程度上实现了新实验模型训练过程的自动化。研究人员只需告知AI想要测试的调整方案 ,AI便能自行实施这些更改、对新模型进行实验并监控结果。该员工还表示,近几个月来,这些模型在实验过程中遇到问题时 ,自我修正的能力也有了显著提升 。

上一篇:最近【北京尾气限行时间,北京尾号限行轮换时间2024】
下一篇:最近【今天限车限行几号,今天限车限行几号开始】
相关文章