InSQuAD:基于子可分相互信息实现质量与多样性的上下文学习高效检索
机器学习
2025-08-29 v1
摘要
本文介绍InSQuAD,旨在通过子可分相互信息(SMI)实现对In-Context Learning(ICL)模型的质量与多样性,以提升其性能。InSQuAD通过两个主要策略实现这一目标:首先,我们将ICL任务建模为目标选择问题,提出基于SMI的统一选择策略,从而从质量和多样性的概念出发,从矗立的ICL示例中挖掘相关且多样的示例。其次,我们针对现有检索模型常忽视ICL关键多样性性的问题,提出一种基于似然损失的组合训练范式,以学习SMI函数的参数,以在检索模型中强制执行质量和多样性。为进一步辅助学习过程,我们将现有的多跳问答数据集增强为包含合成 paraphrase 的数据集。采用采用本策略训练的检索模型,结合ICL的新型目标选择公式,在九个基准数据集上显示出显著的改进,验证了我们方法的有效性。
引用
@article{arxiv.2508.21003,
title = {InSQuAD: In-Context Learning for Efficient Retrieval via Submodular Mutual Information to Enforce Quality and Diversity},
author = {Souradeep Nanda and Anay Majee and Rishabh Iyer},
journal= {arXiv preprint arXiv:2508.21003},
year = {2025}
}
备注
Long Version of paper Accepted to ICDM 2025