冻结大语言模型的证据突出学习
计算与语言
2026-04-27 v1 人工智能
摘要
大型语言模型(LLMs)虽然推理能力较强,但常常在证据被埋藏在长篇噪声上下文中时忽略决定性证据。我们引入HiLight(证据突出框架),其将证据选择与推理解耦,以适用于冻结LLM求解器。HiLight通过训练轻量级突出演员,在 unaltered context 中插入最小的突出标签,以突出显示不可忽略的片段。随后,冻结求解器将在突出后的输入上进行下游推理。我们将突出建模为弱监督决策问题,并仅使用求解器的任务奖励对演员进行强化学习优化,无需证据标签,无需访问或修改求解器。在顺序推荐和长上下文问答任务上,HiLight consistently improve performance over strong prompt-based and automated prompt-optimization baselines。该学习到的突出策略在零-shot情况下可转移至更小和更大的未见求解器家族,包括基于API的求解器,这表明演员捕获的是真正的、可重用的证据结构,而非对单个 backbone 过拟合。
引用
@article{arxiv.2604.22565,
title = {Learning Evidence Highlighting for Frozen LLMs},
author = {Shaoang Li and Yanhang Shi and Yufei Li and Mingfu Liang and Xiaohan Wei and Yunchen Pu and Fei Tian and Chonglin Sun and Frank Shyu and Luke Simon and Sandeep Pandey and Xi Liu and Jian Li},
journal= {arXiv preprint arXiv:2604.22565},
year = {2026}
}