中文

P-Aligner:通过原则导向的指令合成实现语言模型的预对齐

计算与语言 2025-08-07 v1 人工智能

摘要

大型语言模型(LLM)在与人类用户交互时预期产生安全、有帮助且诚实的内容,但在给定错误指令时(例如缺少上下文、模糊的指令或不合适的语气)常常无法对齐这些价值观,这在多个维度上都留下了 substantial 的提升空间。一种成本效益高且影响大的做法是,在模型开始解码之前对指令进行预对齐。现有的做法要么依赖不可接受的测试时搜索成本,要么是端到端的模型重写,这需要由不清晰目标驱动的定制训练语料库。在本工作中,我们展示了通过 P-Aligner 实现指令高效且有效的偏好对齐是一个可行目标。P-Aligner 是一个轻量级模块,生成能够在更符合人类偏好形式下保留原始意图的指令。P-Aligner 在通过蒙特卡洛树搜索生成的原则导向管道合成的 UltraPrompt 数据集上进行训练,该管道系统性地探索与人类偏好紧密相关的备选指令空间。跨不同方法的实验表明,P-Aligner 在各种模型和基准测试中普遍优于强大基线,包括在 GPT-4-turbo 和 Gemma-2-SimPO 上的平均胜率提升分别为 28.35% 和 8.69%。进一步分析从多个角度验证了其有效性和效率,包括数据质量、搜索策略、迭代部署和时间开销。

关键词

引用

@article{arxiv.2508.04626,
  title  = {P-Aligner: Enabling Pre-Alignment of Language Models via Principled Instruction Synthesis},
  author = {Feifan Song and Bofei Gao and Yifan Song and Yi Liu and Weimin Xiong and Yuyang Song and Tianyu Liu and Guoyin Wang and Houfeng Wang},
  journal= {arXiv preprint arXiv:2508.04626},
  year   = {2025}
}