中文

基于内在调节的自合成偏好数据对齐大型语言模型

计算与语言 2025-09-09 v1 人工智能

摘要

大型语言模型 (LLM) 需要高质量的偏好数据集才能与人类偏好一致。然而,传统方法构建此类数据集面临诸多挑战:依赖预收集的指令常导致与目标模型之间的分布不匹配,而需要对多个随机响应进行采样会引入巨大的计算开销。本文通过利用 LLM 表示空间的内在调节,探索一种高效且量身定制的偏好数据集构建范式,称为 Icon2{}^2。具体而言,它首先提取各层方向向量来编码精细的人类偏好,然后利用这些向量基于其内在一致性筛选自合成指令。在解码过程中,应用双向内在控制来驾驭 token 表示,从而实现对具有清晰对齐区别的响应对的精确生成。实验结果表明,该方法在对齐性和效率方面均实现了显著提升。Llama3-8B 和 Qwen2-7B 在 AlpacaEval 2.0 和 Arena-Hard 上实现了平均胜率提升 13.89% 和 13.45%,同时将计算成本降低最高 48.1%。

关键词

引用

@article{arxiv.2509.05605,
  title  = {Icon$^{2}$: Aligning Large Language Models Using Self-Synthetic Preference Data via Inherent Regulation},
  author = {Qiyuan Chen and Hongsen Huang and Qian Shao and Jiahe Chen and Jintai Chen and Hongxia Xu and Renjie Hua and Ren Chuan and Jian Wu},
  journal= {arXiv preprint arXiv:2509.05605},
  year   = {2025}
}

备注

EMNLP 2025 Main