研究

NeuroStrike:我们针对LLM安全对齐的攻击研究被NDSS 2026录用

一个大模型的整套安全对齐,可能只由极少数神经元支撑。我们的论文展示了如何找到它们,以及关闭它们之后会发生什么。

← 返回研究

我们的论文《NeuroStrike: Neuron-Level Attacks on Aligned LLMs》被NDSS Symposium 2026录用,这是网络与系统安全领域的顶级会议之一。这项研究由Sentinel Assurance联合创始人Lichao Wu,与达姆施塔特工业大学的Sasha Behrouzi、Mohamadreza Rostami、Maximilian Thang、Ahmad-Reza Sadeghi,以及萨格勒布大学与拉德堡德大学的Stjepan Picek共同完成。

NeuroStrike做了什么

经过对齐的大模型会拒绝有害或违反政策的请求,靠的是特定的内部机制,而不是模型"理解"了请求有问题。NeuroStrike找到了触发这种拒绝行为的一小部分神经元,并将它们抑制。

  • 在20多个开源与闭源模型上完成测试。
  • 移除不到0.6%的神经元,就能让模型的安全对齐几乎完全失效。
  • 白盒场景(攻击者可访问模型)下平均攻击成功率达76.9%。
  • 黑盒场景(攻击者无法访问模型)下平均攻击成功率达63.7%。
  • 这些"安全神经元"在微调和蒸馏后的模型变体中依然存在,攻击成功率同样保持在77%至78%左右。

最后一点最值得关注。修复基础模型的对齐问题,并不能可靠地修复在它之上构建的一切。一个微调或蒸馏出的变体,即使原始模型已被加固,也可能继承同样的结构性弱点。

我们的看法

这类发现正是我们创立Sentinel的原因。安全对齐常常被当作发布时一次性检查完就万事大吉的事情,但NeuroStrike这样的研究说明,它更应该被视为一项需要持续、独立验证的属性,尤其是当这些模型被接入拥有真实系统权限的Agent之后。

想和研究团队聊聊?

我们很乐意分享Sentinel背后的研究工作,或探讨它如何应用于你的AI Agent。