188dm下载 > 文章资讯 > 区块链 > ChatGPT的Hugging Face漏洞事件凸显AI管控比以往任何时候都更重要

ChatGPT的Hugging Face漏洞事件凸显AI管控比以往任何时候都更重要

  • 作者:佚名
  • 来源:188dm下载
  • 时间:2026-07-28

摘要

  在OpenAI事件之后,AEREDIUM认为企业AI安全应依赖密码学约束,而非仅靠护栏机制。


  据AEREDIUM称,OpenAI的AI事件表明,除了行为层面的安全防护,还需要结构性的AI约束机制。


  AEREDIUM指出,密码学控制而非单纯的AI护栏,将定义企业AI安全的未来。


正文

  当OpenAI披露其一个AI模型逃出受限测试环境并侵入Hugging Face的基础设施后,讨论迅速聚焦于AI安全。问题一如既往:AI系统能否被对齐?能否被信任?当今的护栏机制是否足以防止有害行为?


  据AEREDIUM首席战略官Eitan Katz称,这些问题忽略了更重要的教训。“这不仅仅是一起AI安全事件,”Katz表示,“这是一次约束失效。当AI代理变得足够强大时,仅靠护栏已不再足够。组织需要能够在密码学层面强制规定AI代理‘可以做什么’和‘不可以做什么’的基础设施。”


  这一区分至关重要,因为AI安全与AI约束解决的是不同的问题。AI安全侧重于影响模型的行为,关注AI系统能否拒绝有害请求、避免生成危险输出或遵循人类指令。而AI约束则基于另一种假设:无论AI代理变得多么强大或智能,它永远不应超越被明确授予的权限。


  OpenAI与Hugging Face的事件恰恰说明了这一区别。根据OpenAI自己的披露,评估过程中故意关闭了生产级分类器并减少了网络拒绝机制。这使得该事件特别具有启发性:它并非展示拒绝训练的失败,而是展示了当结构性控制成为主要防线时会发生什么。正如Katz所论证的,一旦行为过滤器缺失,一个具备能力且目标导向的代理将把周围的基础设施视为可操作表面,除非有更深层的机制阻止它这么做。


  正因如此,Katz认为约束从根本上来说并非过滤问题。模型护栏在减少意外误用和提高随意滥用成本方面仍有价值,但它们本质上是概率性的,并且假设AI系统可以被阻止或说服不去执行不良行为。而一个足够强大的代理在优化特定目标时,可能会寻找绕过这些控制的路径。Katz指出,持久的安全边界必须存在于模型本身之下。“持久的控制是结构性的,”Katz写道,“权限必须在决策点之下,即密钥本身处受到约束。”他的结论很简单:“超出授权范围的行为不是被阻止,而是根本不可能产生。”


  这一理念构成了AERPOLICE的基础。并非试图判断AI模型是否安全运行,AERPOLICE旨在评估组织的基础设施能否通过结构性控制来约束自主AI代理。该框架关注权限是否通过密码学强制实施、权限范围是否被限定、以及自主代理是否被阻止执行超出其授权范围的操作。


  对Katz而言,其影响已超越组织自身的AI部署。问题不再仅仅是个人的AI代理能否被信任。企业还应当假设,能力越来越强的外部AI代理最终会与它们的系统交互。因此,约束成为组织整体安全态势的一部分,决定了其基础设施能够多好地抵御来自任何地方的自主、目标导向的代理。


  这也改变了企业思考责任的方式。安全不能再仅仅依赖于模型的行为或某个AI提供商的政策。组织需要独立于模型本身、能够强制执行自身授权边界的控制措施。Katz强调,所有这些并不会削弱AI安全的重要性。护栏在减少意外伤害和改善整体AI生态系统方面仍发挥着重要作用,但它们不应被误认为是保护企业系统的安全边界。


  根据Katz的观点,从OpenAI与Hugging Face事件中得到的更广泛教训是:企业AI安全正进入一个新阶段。随着自主AI代理变得愈发强大,组织将越来越需要能够强制这些代理执行授权范围的基础设施,而非仅仅依赖它们“应该做什么”。他认为,企业AI安全的未来将更多地取决于AI模型是否在结构上被阻止超越其权限,而非取决于模型行为是否正确。