将块视为臂:基于多臂老虎机引导的长上下文 LLM 偏好优化
计算与语言
2026-04-10 v2 人工智能
摘要
长上下文建模对于广泛的实际任务至关重要,包括长上下文问答、摘要和复杂推理任务。最近的研究探索了使用合成数据微调大型语言模型(LLM)以增强其长上下文能力。然而,这类方法的有效性常常受限于生成数据中的低样本多样性和事实性不一致。为此,我们提出 LongMab,一个新框架,利用多臂老虎机(MAB)滚动策略识别给定长上下文中最具信息量的块,以对高质量和多样化的响应进行抽样并构建偏好数据对,以进行直接偏好优化(DPO)训练。具体而言,我们将上下文块视为 MAB 的臂项,根据其预期奖励得分选择块输入到 LLM 中生成响应,并根据奖励反馈迭代更新这些得分。在滚动过程中进行的探索和开发,使 LLM 能够专注于最相关的上下文片段,从而生成和收集高质量和多样化的响应。在 Llama 和 Qwen 上的实验结果表明,LongMab 通过在长上下文推理基准测试上取得超过 4% 的提升,证明了其有效性。所有数据和代码将发布于 https://github.com/NEUIR/LongMab-PO。
引用
@article{arxiv.2508.13993,
title = {Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization},
author = {Shaohua Duan and Pengcheng Huang and Xinze Li and Zhenghao Liu and Xiaoyuan Yi and Yukun Yan and Shuo Wang and Yu Gu and Ge Yu and Maosong Sun},
journal= {arXiv preprint arXiv:2508.13993},
year = {2026}
}
备注
17 pages