对LLM对抗性对齐要求更简单、可复现且更可衡量的目标
机器学习
2025-02-24 v2
摘要
过去十年来,误alignment的研究目标在对抗鲁棒性研究中造成了 considerable 的阻碍。例如,广泛关注优化目标指标而忽视严格的标准化评估,导致研究者追求一些 ad-hoc heuristic防御措施,这些措施看似有效。然而,这些大多数措施后来都被后续评估暴露为存在缺陷,最终对该领域的可衡量进展贡献甚微。在本position paper中,我们说明当前针对大型语言模型(LLM)的对抗性对齐研究风险可能重复过去的模式,潜在引发更严重的现实后果。为此,我们认为对抗性对齐的重新对齐目标是实现有意义进展所必需的。基于此,我们在建立的网络安全分类框架中,正式定义了过去与新兴威胁模型之间的差异,这些模型适用于LLM。通过该框架,我们说明进展需要将对抗性对齐分解为可处理的子问题,并返回核心学术原则,如可衡量性、可复现性和可比较性。尽管该领域面临诸多挑战,但对抗鲁棒性的重新出发提供了独特的机会,既能效仿过去的经验,又能避免以往的错误。
引用
@article{arxiv.2502.11910,
title = {Adversarial Alignment for LLMs Requires Simpler, Reproducible, and More Measurable Objectives},
author = {Leo Schwinn and Yan Scholten and Tom Wollschläger and Sophie Xhonneux and Stephen Casper and Stephan Günnemann and Gauthier Gidel},
journal= {arXiv preprint arXiv:2502.11910},
year = {2025}
}