中文

LongDPO:通过批判性增强的分步信息提升大语言模型的长程生成能力

计算与语言 2025-05-21 v2

摘要

长程生成对于学术论文写作和仓库级代码生成至关重要。尽管如此,当前模型(包括GPT-4o)仍表现不佳。现有方法利用结果监督进行偏好学习,往往无法为扩展上下文提供详细反馈。这一不足可能导致内容未完全满足查询要求,引发长度偏差和质量下降问题。本文提出通过纳入过程监督来增强长程生成。我们采用蒙特卡洛树搜索收集分步偏好对,利用全局记忆池维持一致性。为解决候选选择不佳的问题,我们整合外部批判以细化和提升偏好对质量。最后,我们应用基于收集的分步偏好对进行层级DPO。实验结果表明,我们的方法在长程生成基准测试中提升了长度和质量,在各种模型 Backbone 上几乎保持原有性能。

关键词

引用

@article{arxiv.2502.02095,
  title  = {LongDPO: Unlock Better Long-form Generation Abilities for LLMs via Critique-augmented Stepwise Information},
  author = {Bowen Ping and Jiali Zeng and Fandong Meng and Shuo Wang and Jie Zhou and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2502.02095},
  year   = {2025}
}

备注

ACL 2025