中文

IterAlign:大型语言模型的迭代宪法对齐

计算与语言 2024-03-28 v1

摘要

随着大型语言模型(LLM)的快速发展,使LLM与人类价值观和社会规范对齐以确保其可靠性和安全性变得至关重要。基于人类反馈的强化学习(RLHF)和宪法人工智能(CAI)已被提出用于LLM对齐。然而,这些方法需要大量的人工标注或明确预定义的宪法,这既费时又费力。为了克服这些缺点,我们研究了基于宪法的LLM对齐,并提出了一种名为IterAlign的数据驱动宪法发现和自对齐框架。IterAlign利用红队测试揭示LLM的弱点,并使用更强的LLM自动发现新的宪法。这些宪法随后用于指导基础LLM的自我纠正。这种宪法发现流程可以迭代自动运行,以发现专门针对当前LLM对齐差距的新宪法。在多个安全基准数据集和多个基础LLM上的实验结果表明,IterAlign成功提高了真实性、有用性、无害性和诚实性,将LLM对齐的无害性提升了高达13.5%。

关键词

引用

@article{arxiv.2403.18341,
  title  = {IterAlign: Iterative Constitutional Alignment of Large Language Models},
  author = {Xiusi Chen and Hongzhi Wen and Sreyashi Nag and Chen Luo and Qingyu Yin and Ruirui Li and Zheng Li and Wei Wang},
  journal= {arXiv preprint arXiv:2403.18341},
  year   = {2024}
}

备注

NAACL 2024