实体作为检索信号:关于实体导向排序中覆盖范围、监督与评估的系统性研究
信息检索
2026-04-08 v1
摘要
实体导向检索假设相关文档 exhibits 查询相关实体,但评估结果报告存在矛盾。我们指出这种不一致并非源于模型失效,而是源于评估方法。在TREC Robust04上,我们对六个神经重排序器和437个无监督配置进行评估,与BM25进行比较。在443个系统中,没有任何系统在对全部分析候选集合进行开放世界评估时,MAP提升超过0.05,尽管在实体受限设置下表现显著。最佳配置匹配官方Robust04最佳系统,并优于大多数神经重排序器,这表明体系结构并非瓶颈所在。相反,瓶颈在于实体通道:即使在理想化选择下,实体信号仅覆盖19.7%的相关文档,且没有方法同时实现高覆盖率和判别性。我们通过区分概念实体相关性(CER)——语义关联性——和可观察实体相关性(OER)——在给定链接器下以语料库为依据的判别性来加以解释。所有监督策略都在CER层面运作,忽略了链接环境,导致信号在语义上有效但不具判别性。改进监督并不能恢复开放世界性能:更强的信号会降低覆盖率而不提升效果。条件评估和开放世界评估回答不同问题:利用实体证据 versus 在现实链接条件下提高检索效果,但两者常被混合。需要的数据集应具备实体层面的判别性,评估方法应报告覆盖率和效果。只有这样,条件性收益才能暗示开放世界效果,开放世界失败也不必然否定基于实体的模型。
引用
@article{arxiv.2604.05204,
title = {Entities as Retrieval Signals: A Systematic Study of Coverage, Supervision, and Evaluation in Entity-Oriented Ranking},
author = {Shubham Chatterjee},
journal= {arXiv preprint arXiv:2604.05204},
year = {2026}
}