研究
来自团队的研究与动态
论文、研究发现,以及Sentinel团队的最新进展。
研究
一套关于数据污染的通用理论,发表于JMLR
我们关于监督学习中数据污染通用理论的论文发表于Journal of Machine Learning Research(JMLR)。这篇文章介绍研究发现。
研究GateBreaker:我们针对混合专家大模型安全对齐的攻击研究被USENIX Security 2026录用
我们关于攻击混合专家(MoE)大模型安全对齐的论文被USENIX Security 2026录用。这篇文章介绍研究发现。
研究NeuroStrike:我们针对LLM安全对齐的攻击研究被NDSS 2026录用
我们关于对齐大模型神经元级攻击的论文被NDSS Symposium 2026录用。这篇文章介绍研究发现。
研究COPA 2024最佳论文:数据污染下的保形预测
我们的获奖论文,研究校准数据被污染时保形预测的表现。这篇文章介绍研究发现。
研究检验无法给出概率的生成模型,发表于NeurIPS 2022
我们发表于NeurIPS 2022的论文,研究如何检验只能采样、无法给出概率的生成模型。这篇文章介绍研究发现。
研究我们关于弱监督学习的著作,由MIT Press出版
我们关于弱监督学习的著作由MIT Press出版。这篇文章介绍这本书的内容。
研究检验模型能否拟合弯曲空间上的数据,发表于ICML 2021
我们发表于ICML 2021的论文,研究弯曲几何空间上模型的拟合优度检验。这篇文章介绍研究发现。
研究NeurIPS 2017最佳论文:一种时间复杂度线性增长的拟合优度检验
我们发表于NeurIPS 2017的最佳论文,提出一种时间复杂度随样本量线性增长的拟合优度检验。这篇文章介绍研究发现。