中文

无需生成的评估:应用于 CSAM 的有害模型专化的非生成性评估

机器学习 2026-04-29 v1 计算机与社会

摘要

审计开源生成模型的精调版本以识别有害专化已成为模型托管平台的新治理挑战。标准工具包——通过精心挑选的提示或红队测试的生成性评估——无法在平台层面进行规模化审计,且在 CSAM 等领域完全失效。这迫使我们面临“无需生成的评估”问题:在不产生输出的情况下评估模型能力。我们认为,在此类情境下,能力必须从模型的状态(其参数或内部表示)而非其输出中推断。我们引入了高斯探针 (Gaussian probing) 方法,这一方法通过测量对高斯潜在集合的响应来表征 LoRA 适配器如何扰动模型的内部表示。与原始权重基线相比,高斯探针可可靠地区分良性与有害专化,而无需抽样输出。我们在包括检测针对儿童性暗示物质(CSAM)的模型专化在内的高风险领域中展示了其有效性。在这些领域,基于输出的评估受到法律和伦理限制。我们的结果表明,高斯探针为评估高风险生成系统提供了可扩展的非生成性替代方案,并且对权重重新缩放(一种代表性对抗性操纵)仍然稳健。

关键词

引用

@article{arxiv.2604.25119,
  title  = {Evaluation without Generation: Non-Generative Assessment of Harmful Model Specialization with Applications to CSAM},
  author = {Vinith M. Suriyakumar and Ayush Sekhari and Lena Stempfle and Robertson Wang and Michael Simpson and Rebecca Portnoff and Marzyeh Ghassemi and Ashia C. Wilson},
  journal= {arXiv preprint arXiv:2604.25119},
  year   = {2026}
}