中文

基于负提示的生成式语言模型对齐方法

计算与语言 2024-10-17 v1

摘要

大型语言模型已取得显著进展,但将其输出与人类价值和偏好进行对齐仍然是一个重大挑战。现有的对齐方法主要关注正面示例,忽视了负面响应在引导模型远离不可取行为方面的重要性。例如,广泛使用的对齐数据集显示,缺乏与人类价值相矛盾的明确负面示例,阻碍了其在训练期间抑制有害或偏见输出的能力。为解决此限制,我们提出了 NEAT,即 NEgative-prompt-driven AlignmenT(负提示驱动的对齐),用于在优化过程中引入负提示以生成不可取响应,同时伴随正面示例。NEAT 明确惩罚模型产生有害输出,引导其不仅朝向可取行为,还能引导其远离生成不可取、偏见性响应。这种双反馈机制实现了更好的人类偏好对齐,在避免造成伤害方面至关重要。从预训练语言模型开始,NEAT 通过纳入来自包含正面和负面示例的扩展偏好数据集派生的排序损失进行在线对齐。大量实验验证了 NEAT 在显著增强语言模型与人类价值和偏好对齐方面的有效性。

关键词

引用

@article{arxiv.2410.12194,
  title  = {Negative-Prompt-driven Alignment for Generative Language Model},
  author = {Shiqi Qiao and Ning Xv and Biao Liu and Xin Geng},
  journal= {arXiv preprint arXiv:2410.12194},
  year   = {2024}
}