基于多臂老虎机优化的情境归因
人工智能
2026-04-23 v2
摘要
理解大语言模型生成答案所依赖的检索上下文的哪些部分,对于构建可解释且可信的检索增强生成系统至关重要。我们提出了一个新框架,将情境归因形式化为组合多臂老虎机问题。我们利用线性 Thompson 采样方法高效识别最具影响力的上下文片段,同时最小化模型查询次数。我们的奖励函数利用标记对数概率来衡量特定片段子集对原始响应的支持程度,适用于开源模型和黑箱 API 模型。与基于 SHAP 和其他扰动方法均匀抽样子集不同,我们的方法根据片段相关性的后验估计自适应地优先考虑信息丰富的子集,从而降低计算成本。在多个 QA 基准测试中进行的实验表明,我们的方法在模型查询次数上可减少最高30%,同时实现或超越现有方法的归因质量。我们的代码已公开于 https://github.com/pd90506/camab。
引用
@article{arxiv.2506.19977,
title = {Context Attribution with Multi-Armed Bandit Optimization},
author = {Deng Pan and Keerthiram Murugesan and Ting Hua and Nuno Moniz and Nitesh Chawla},
journal= {arXiv preprint arXiv:2506.19977},
year = {2026}
}
备注
Accepted as a Findings paper at ACL 2026