中文

T-检索性:面向主题的文档公平曝露度量方法

信息检索 2025-11-19 v2

摘要

文档检索性是一个基于集合的统计量,衡量其在特定截断排名内被检索的预期(倒数)排名。具有均匀分布检索性得分的集合是公平文档曝露的指标。虽然检索性得分已被用于量化集合中文档的公平曝露,但在本工作中,我们使用检索性得分的分布来衡量检索模型的曝露偏差。我们假设文档检索性得分在整个集合中的不均匀分布并不准确地反映曝露偏差,而是指示主题相关性的变化。作为解决方案,我们提出一种面向主题的局部化检索性度量,称为 T-检索性(topic-retrievability),该方法首先在多个与主题相关文档组上计算检索性得分,然后聚合这些局部化值以获得集合水平统计数据。我们使用该提议的 T-检索性度量进行分析,揭示了各种神经排序模型的曝露特征的新见解。研究表明,这种局部化度量提供了更细致的公平性理解,为评估 IR 系统中的文档可达性提供了更可靠的方法。

关键词

引用

@article{arxiv.2508.21704,
  title  = {T-Retrievability: A Topic-Focused Approach to Measure Fair Document Exposure in Information Retrieval},
  author = {Xuejun Chang and Zaiqiao Meng and Debasis Ganguly},
  journal= {arXiv preprint arXiv:2508.21704},
  year   = {2025}
}

备注

Accepted by Proceedings of the 34th ACM International Conference on Information and Knowledge Management (CIKM 2025), November 10-14, 2025, Seoul, Republic of Korea