中文

RIDE:通过重新风格化的情境学习示范样本增强大语言模型对齐

计算与语言 2025-03-06 v4 人工智能

摘要

对齐调优对于确保大型语言模型(LLM)行为符合伦理和实用性至关重要。当前的对齐方法需要高质量的标注和大量的训练资源。本文提出了一种低成本、无需调参的方法,利用情境学习(ICL)来增强LLM的对齐能力。通过对高质量ICL演示的分析,我们识别出风格是影响LLM对齐能力的关键因素,并基于这一风格框架对ICL示例进行了显式的风格重构。此外,我们将重风格化的示例组合在一起,以实现LLM对齐中两个相互冲突方面的平衡——事实性和安全性。我们将重风格化的示例打包为提示词,以触发少数样本学习,从而提高LLM的对齐性能。与最佳基线方法相比,我们的方法在Alpaca任务上实现了最高0.10的提升(从4.50提升至4.60),在Just-eval基准上提升了0.22(从4.34提升至4.56),在MT-Bench数据集上实现了最高0.32的提升(从3.53提升至3.85)。我们将代码和数据发布于 https://github.com/AnonymousCode-ComputerScience/RIDE。

关键词

引用

@article{arxiv.2502.11681,
  title  = {RIDE: Enhancing Large Language Model Alignment through Restyled In-Context Learning Demonstration Exemplars},
  author = {Yuncheng Hua and Lizhen Qu and Zhuang Li and Hao Xue and Flora D. Salim and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2502.11681},
  year   = {2025}
}

备注

38 pages, 2 figures, 20 tables; The paper is under review in ARR