中文

鲁棒神经信息检索:对抗性与分布外视角

信息检索 2024-08-19 v2 人工智能 计算与语言 机器学习

摘要

近期神经信息检索(IR)模型的进展显著提升了其在各种IR任务上的效果。确保这些模型在实际中可靠性的鲁棒性也受到广泛关注。随着针对鲁棒IR的各种研究提出,我们认为是时候整合当前的现状,澄清现有方法的洞见,并为未来发展奠定基础。我们认为IR的鲁棒性是一个多方面的概念,强调其必须抵御对抗性攻击、分布外(OOD)情景以及性能波动。我们聚焦于对抗性和OOD鲁棒性,分别剖析稠密检索模型(DRMs)和神经排序模型(NRMs)的鲁棒性解决方案,认识到它们是神经IR管道中的关键组件。我们提供对现有方法、数据集和评估指标的深入讨论,阐明了在大型语言模型时代的挑战和未来方向。据我们所知,这是首个关于神经IR模型鲁棒性的综合性调查报告,我们还将在SIGIR 2024上首次进行教程性演示 \url{https://sigir2024-robust-information-retrieval.github.io}。在组织既有工作的同时,我们引入了鲁棒IR基准(BestIR),一个用于鲁棒神经信息检索的异构评估基准,已在 \url{https://github.com/Davion-Liu/BestIR} 上公开。我们希望本研究为未来在IR模型鲁棒性方面的研究提供有用的线索,并帮助开发可信赖的搜索引擎 \url{https://github.com/Davion-Liu/Awesome-Robustness-in-Information-Retrieval}。

关键词

引用

@article{arxiv.2407.06992,
  title  = {Robust Neural Information Retrieval: An Adversarial and Out-of-distribution Perspective},
  author = {Yu-An Liu and Ruqing Zhang and Jiafeng Guo and Maarten de Rijke and Yixing Fan and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2407.06992},
  year   = {2024}
}

备注

Survey paper