可控安全对齐:适应多样化安全需求的推理时适应
计算与语言
2025-03-05 v2 人工智能
摘要
当前大型语言模型(LLM)的安全对齐范式遵循“一刀切”方法:模型拒绝与任何由模型提供方认为不安全的内容交互。这种方法在面对不同文化和地区的社会规范时缺乏灵活性。此外,用户可能有多样化的安全需求,使具有固定安全标准的模型既过于严格难以实用,又难以进行重新对齐。我们提出了可控安全对齐框架(CoSA),旨在无需重新训练即可适应多样化的安全需求。我们不对固定模型进行对齐,而是对随系统提示提供的安全配置——即所需安全行为的自由形式自然语言描述的模型进行对齐。通过修改这些安全配置,授权用户仅需在推理时进行调整即可更改模型的安全行为。为实现这一点,我们提出了CoSAlign——一种数据中心的方法,用于对齐LLM以轻松适应多样化的安全配置。此外,我们设计了一种新颖的可控性评估协议,考虑有用性和配置的安全性,将其概括为CoSA-Score得分,构建了CoSApien——一个由人类编写的基准,包含真实世界的LLM应用场景,涉及多样化的安全需求和相应的评估提示。我们展示,CoSAlign在包括基于情境对齐在内的强大基准上,实现了可控性的显著提升。我们的框架鼓励更好地代表和适应LLM中的多元人类价值观,从而提高其实用性。
引用
@article{arxiv.2410.08968,
title = {Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements},
author = {Jingyu Zhang and Ahmed Elgohary and Ahmed Magooda and Daniel Khashabi and Benjamin Van Durme},
journal= {arXiv preprint arXiv:2410.08968},
year = {2025}
}
备注
ICLR 2025 camera ready