我们的论文《GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs》被USENIX Security 2026录用,这是计算机安全领域的顶级会议之一。这项研究由Sentinel Assurance联合创始人Lichao Wu,与达姆施塔特工业大学的Sasha Behrouzi、Mohamadreza Rostami、Ahmad-Reza Sadeghi,以及萨格勒布大学与拉德堡德大学的Stjepan Picek共同完成。
GateBreaker做了什么
混合专家(MoE)模型通过为每次输入仅激活一小部分参数来实现规模扩展,这也改变了安全机制在模型内部的存在方式。GateBreaker是首个专门针对这一结构设计的免训练攻击框架。它分三个阶段完成:找到有害提示词会被过度路由到的"安全专家",定位这些专家内部的安全结构,然后将其关闭。
- 免训练、轻量级、与架构无关,无需任何微调。
- 在目标专家层中最多关闭2.9%的神经元,就能让8个最新的对齐MoE模型的平均攻击成功率从7.4%提升到64.9%。
- 这些安全神经元可以在同一模型家族内迁移:一次性迁移攻击的成功率达到67.7%。
- 该方法同样适用于视觉语言MoE模型,在5个模型上针对不安全图像输入的成功率达到60.9%。
- 即使关闭了目标神经元,模型的可用性下降也十分有限。
迁移能力这一点最值得关注。如果一个MoE模型的安全弱点能够预示同一家族其他模型的弱点,那么只测试单个模型版本就宣称整个家族安全,是远远不够的。
我们的看法
混合专家(MoE)正在迅速成为前沿模型的默认架构,而大多数安全工具仍是为上一代架构打造的。这样的研究结果提醒我们,新架构可能带来新的失效模式,一项技术在上一代模型上有效,并不能保证它在新一代模型上依然成立。这正是独立的、部署前验证所要在Agent被赋予真实权限之前发现的那类问题。