对齐算法的机制性理解:以 DPO 和毒性为例
计算与语言
2024-01-05 v1 人工智能
摘要
虽然对齐算法现在常用于微调预训练语言模型以适应用户偏好,但我们缺乏对模型如何变得“对齐”的底层机制的解释,这使得难以解释越狱等现象。在这项工作中,我们研究了一种流行的算法——直接偏好优化 (DPO),以及其降低毒性的机制。具体而言,我们首先研究毒性如何在预训练语言模型 GPT2-medium 中表示和引发。然后,我们应用 DPO 配合精心设计的成对数据集来降低毒性。我们检查了结果模型如何避免有毒输出,并发现从预训练中学到的能力并未被移除,而是被绕过。我们利用这一见解展示了一种简单的方法来使模型“去对齐”,使其恢复有毒行为。
引用
@article{arxiv.2401.01967,
title = {A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity},
author = {Andrew Lee and Xiaoyan Bai and Itamar Pres and Martin Wattenberg and Jonathan K. Kummerfeld and Rada Mihalcea},
journal= {arXiv preprint arXiv:2401.01967},
year = {2024}
}