评估稠密检索器在跨学科领域的鲁棒性
信息检索
2025-06-30 v1 人工智能
机器学习
摘要
评估基准的特征可能扭曲领域适应在检索模型中的真实效益。这会导致误导性的评估,从而影响针对特定领域的部署决策。我们展示了两种特征差异巨大的基准测试——主题多样性、边界重叠和语义复杂性——如何影响对微调效益的感知。以环境监管文件检索为案例研究,我们在联邦机构的环境影响声明(EIS)上对ColBERTv2模型进行微调。在具有不同语义结构的两个基准测试上对这些模型进行评估。我们的发现表明,相同的领域适应方法在评估方法论不同的情况下显示出截然不同的感知效益。在一个主题边界清晰分离的基准测试上,领域适应仅显示出小幅改进(最大NDCG提升0.61%)。然而,在另一个语义结构重叠的基准测试上,相同模型显示出显著的改进(最高达2.22% NDCG提升),这是性能效益的3.6倍差异。我们通过主题多样性指标对这些基准进行比较,发现表现更好的基准测试中,上下文之间的平均余弦距离高出11%,轮廓系数低出23%,直接导致观察到的性能差异。这些结果表明,基准测试的选择对特定领域检索系统有效性评估具有决定性影响。在主题分离较明显的评估框架中,常低估了领域适应的效益,而在语义边界重叠的评估框架中,则揭示了更贴近现实监管文件复杂性的改进。我们的发现对开发和部署面向多主题领域的AI系统具有重要意义。
引用
@article{arxiv.2506.21581,
title = {Evaluating the Robustness of Dense Retrievers in Interdisciplinary Domains},
author = {Sarthak Chaturvedi and Anurag Acharya and Rounak Meyur and Koby Hayashi and Sai Munikoti and Sameera Horawalavithana},
journal= {arXiv preprint arXiv:2506.21581},
year = {2025}
}