我们的论文《NeuroStrike: Neuron-Level Attacks on Aligned LLMs》被NDSS Symposium 2026录用,这是网络与系统安全领域的顶级会议之一。这项研究由Sentinel Assurance联合创始人Lichao Wu,与达姆施塔特工业大学的Sasha Behrouzi、Mohamadreza Rostami、Maximilian Thang、Ahmad-Reza Sadeghi,以及萨格勒布大学与拉德堡德大学的Stjepan Picek共同完成。
NeuroStrike做了什么
经过对齐的大模型会拒绝有害或违反政策的请求,靠的是特定的内部机制,而不是模型"理解"了请求有问题。NeuroStrike找到了触发这种拒绝行为的一小部分神经元,并将它们抑制。
- 在20多个开源与闭源模型上完成测试。
- 移除不到0.6%的神经元,就能让模型的安全对齐几乎完全失效。
- 白盒场景(攻击者可访问模型)下平均攻击成功率达76.9%。
- 黑盒场景(攻击者无法访问模型)下平均攻击成功率达63.7%。
- 这些"安全神经元"在微调和蒸馏后的模型变体中依然存在,攻击成功率同样保持在77%至78%左右。
最后一点最值得关注。修复基础模型的对齐问题,并不能可靠地修复在它之上构建的一切。一个微调或蒸馏出的变体,即使原始模型已被加固,也可能继承同样的结构性弱点。
我们的看法
这类发现正是我们创立Sentinel的原因。安全对齐常常被当作发布时一次性检查完就万事大吉的事情,但NeuroStrike这样的研究说明,它更应该被视为一项需要持续、独立验证的属性,尤其是当这些模型被接入拥有真实系统权限的Agent之后。