ABNIRML:神经信息检索模型行为分析
计算与语言
2023-07-21 v2 信息检索
摘要
BERT 和 T5 等预训练上下文语言模型已经为即席检索建立了新的最先进水平。然而,目前尚不清楚这些方法为何如此有效、是什么使某些变体比其他变体更有效,以及它们可能存在哪些缺陷。我们提出了一个用于分析神经信息检索模型行为(ABNIRML)的新综合框架,该框架包含新型诊断探针,可让我们测试先前技术未涉及的一些特征——如写作风格、事实性、对改写和词序的敏感性。为展示该框架的价值,我们开展了一项广泛的实证研究,深入揭示了促成神经模型性能提升的因素,并识别出模型所表现出的潜在非预期偏差。我们的一些结果印证了传统认知,例如近期的神经排序模型较少依赖与查询的精确词项重叠,而是利用更丰富的语言信息,这体现在它们对词和句子顺序更高的敏感性上。其他结果则更令人意外,例如某些模型(如 T5 和 ColBERT)偏向于事实正确的(而非仅仅相关的)文本。此外,某些特征即使对于同一基础语言模型也会变化,而其他特征可能由于模型训练期间的随机变化而出现。
引用
@article{arxiv.2011.00696,
title = {ABNIRML: Analyzing the Behavior of Neural IR Models},
author = {Sean MacAvaney and Sergey Feldman and Nazli Goharian and Doug Downey and Arman Cohan},
journal= {arXiv preprint arXiv:2011.00696},
year = {2023}
}
备注
TACL version