中文

域适应稠密检索器的可解释性分析

信息检索 2025-01-27 v1 人工智能

摘要

稠密检索器已显示出在神经信息检索中具有巨大的潜力,但它们对域迁移缺乏鲁棒性,从而限制了其在跨不同域的零样本设置中的有效性。以往的研究探索了无监督域适应技术来适应稠密检索器以适应目标域,但这些研究未关注解释性分析以理解此类适应如何改变模型的行为。在本文中,我们提议利用集成梯度框架开发一种可解释性方法,为稠密检索器提供基于实例的解释和基于排序的解释。为生成这些解释,我们引入了一种新颖的基线,揭示查询和文档的归因。我们使用该方法分析域适应对查询和文档标记在两个数据集上的输入归因:金融问答数据集 (FIQA) 和生物医学信息检索数据集 (TREC-COVID)。我们的可视化结果表明,域适应模型比非适应模型更关注领域术语,具体包括 "hedge"、"gold"、"corona" 和 "disease" 等术语。该研究阐述了无监督域适应技术如何影响稠密检索器在适应到新域后行为。此外,我们证明了集成梯度是解释和分析这些透明的神经模型内部机制的可行选择。

关键词

引用

@article{arxiv.2501.14459,
  title  = {Interpretability Analysis of Domain Adapted Dense Retrievers},
  author = {Goksenin Yuksel and Jaap Kamps},
  journal= {arXiv preprint arXiv:2501.14459},
  year   = {2025}
}