中文

通过完全自合成数据对大语言模型进行对齐

计算与语言 2025-10-09 v1

摘要

传统的大语言模型(LLM)强化学习人类反馈(RLHF)依赖昂贵的人工标注数据集,而基于 AI反馈的强化学习(RLAIF)也面临高额成本,需要收集多样化的提示和相应的响应,常常需要外部奖励模型或像 GPT-4 这样的专有模型来标注偏好对。在本工作中,我们引入 Self-Alignment Optimization(SAO),一种完全自合成的 LLM 对齐框架,其中所有训练数据,包括提示(即用户查询)、响应和偏好,都由模型本身生成。具体而言,SAO 首先指示 LLM 进行人设角色扮演,生成多样化的提示和响应,然后对其进行自评以进行偏好优化。大量实验表明,SAO 在 AlpacaEval~2.0 等标准基准测试中有效提升了模型的聊天能力,同时在下游任务(如问答、数学推理)中保持强性能。我们的工作为 LLM 的自我改进提供了实用解决方案,复现本结果的代码已提供: https://github.com/SJY8460/SAO。

关键词

引用

@article{arxiv.2510.06652,
  title  = {Aligning Large Language Models via Fully Self-Synthetic Data},
  author = {Shangjian Yin and Zhepei Wei and Xinyu Zhu and Wei-Lin Chen and Yu Meng},
  journal= {arXiv preprint arXiv:2510.06652},
  year   = {2025}
}