挑剔的大语言模型与不可靠的奖励模型:指令微调后安全对齐的实证研究
人工智能
2025-02-04 v1 计算与语言
机器学习
摘要
大语言模型(LLMs)已成为处理广泛通用查询和任务的强大工具。尽管如此,在更小、特定领域的数据集上微调已对齐的 LLMs,虽然对使其适应专门任务至关重要,但即使数据集是良性的,也可能无意中降低其安全对齐性。这种现象使模型更容易提供不当的回应。在本研究中,我们系统地考察了在良性微调场景下导致安全对齐性退化的因素。我们的分析识别出影响已对齐 LLMs 的三个关键因素:回答结构、身份校准和角色扮演。此外,我们评估了通常用于指导对齐过程的最先进的奖励模型(RMs)的可靠性。我们的发现表明,这些 RMs 经常无法准确反映人类在安全方面的偏好,突显了它们在实际应用中的局限性。通过揭示这些挑战,我们的工作强调了在微调期间维持安全对齐的复杂性,并为开发者提供了在 LLMs 中平衡效用与安全的指导。我们实验中使用的数据集和微调代码可在 https://github.com/GuanlinLee/llm_instruction_tuning 找到。
引用
@article{arxiv.2502.01116,
title = {Picky LLMs and Unreliable RMs: An Empirical Study on Safety Alignment after Instruction Tuning},
author = {Guanlin Li and Kangjie Chen and Shangwei Guo and Jie Zhang and Han Qiu and Chao Zhang and Guoyin Wang and Tianwei Zhang and Jiwei Li},
journal= {arXiv preprint arXiv:2502.01116},
year = {2025}
}