用反事实直接偏好优化对齐大型语言模型
计算与语言
2024-01-22 v2 人工智能
摘要
大型语言模型(LLM)的进步已在多种应用中展现出卓越能力。这些模型擅长生成上下文连贯、覆盖广泛主题的文本补全。然而,训练所需的海量数据集使得在预训练和指令微调阶段对齐响应风格具有挑战性。因此,通常采用额外的对齐阶段,即使用人类偏好数据进一步训练模型,以使其输出更好地符合人类期望。虽然这个过程本身不会引入新能力,但它会凸显模型固有的生成风格。本文探索了在直接偏好优化(DPO)框架内利用反事实提示来对齐模型风格,无需依赖人工干预。我们证明,该方法能有效灌输理想行为、减轻不良行为,并鼓励模型忽略不恰当的指令。我们的发现表明,结合DPO的反事实提示提供了一种低资源方式微调LLM,以满足负责任且符合伦理的AI系统的需求。
引用
@article{arxiv.2401.09566,
title = {Aligning Large Language Models with Counterfactual DPO},
author = {Bradley Butcher},
journal= {arXiv preprint arXiv:2401.09566},
year = {2024}
}