中文

并非所有都需要:面向大语言模型对齐的低冗余优化

计算与语言 2024-10-04 v2

摘要

大语言模型 (LLM) 在复杂任务和场景中仍难以与人类偏好保持一致。它们容易过拟合训练数据中意外模式或表面样式。我们进行了经验研究,仅选择 LLM 中最顶尖的 10% 参数进行对齐训练,发现这在收敛过程和最终性能方面均取得改进。这表明 LLM 在对齐训练中存在冗余神经元。为减少其影响,我们提出一种低冗余对齐方法,名为 \textbf{ALLO},其核心是针对最相关的神经元来优化最有用的监督信号。具体地,我们首先通过梯度策略识别与人类偏好数据相关的神经元,然后通过奖励模型识别对齐相关的关键 token 以计算损失。此外,我们还将对齐过程分解为遗忘和学习两个阶段,分别通过更新不同比例的神经元来处理不一致的知识和学习一致的知识。在 10 个数据集上的实验结果表明,ALLO 方法有效。我们的代码和数据可在 \url{https://github.com/RUCAIBox/ALLO} 获取。

关键词

引用

@article{arxiv.2406.12606,
  title  = {Not Everything is All You Need: Toward Low-Redundant Optimization for Large Language Model Alignment},
  author = {Zhipeng Chen and Kun Zhou and Wayne Xin Zhao and Jingyuan Wang and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2406.12606},
  year   = {2024}
}

备注

14 pages, working in progress