SoLoPO:通过短到长偏好优化实现大语言模型的长程上下文能力
计算与语言
2025-10-14 v2 人工智能
摘要
尽管在扩展上下文长度方面取得了进展,大语言模型(LLM)仍面临有效利用真实世界长程上下文信息的挑战,主要由于数据质量问题、训练效率不足以及缺乏合理设计的优化目标。为此,我们提出一种名为hrt-to-ng reference ptimization()的框架,将长程偏好优化(PO)解耦为两个组件:短程PO和短到长奖励对齐(SoLo-RA),并得到理论和实证证据的支持。具体而言,短程PO利用从短上下文中抽样的偏好对来增强模型的上下文知识利用能力。而SoLo-RA则显式鼓励在条件为短和长上下文且包含相同任务相关信息时,对响应的奖励得分保持一致。这有助于将模型处理短程上下文的能力迁移到长程场景中。SoLoPO与主流偏好优化算法兼容,同时大幅提高数据构建和训练过程的效率。实验结果表明,SoLoPO在各种长程基准测试中,使所有算法在更强的长度和领域泛化能力方面获得显著提升,同时在计算和内存效率方面取得显著改进。
引用
@article{arxiv.2505.11166,
title = {SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization},
author = {Huashan Sun and Shengyi Liao and Yansen Han and Yu Bai and Yang Gao and Cheng Fu and Weizhou Shen and Fanqi Wan and Ming Yan and Ji Zhang and Fei Huang},
journal= {arXiv preprint arXiv:2505.11166},
year = {2025}
}