T2Ranking:面向段落排序的大规模中文基准
信息检索
2023-04-10 v1
摘要
段落排序包含两个阶段:段落检索与段落重排序,这是信息检索(IR)领域学术界与工业界均关注的重要且具挑战性的课题。然而,常用的段落排序数据集通常聚焦于英语。对于中文等非英语场景,现有数据集在数据规模、细粒度相关性标注及假阴性问题方面存在局限。为应对该问题,我们引入了 T2Ranking,一个面向段落排序的大规模中文基准。T2Ranking 包含来自真实搜索引擎的逾 30 万条查询与超过 200 万条独立段落。我们招募专家标注者为查询-段落对提供 4 级分级相关性分数(细粒度),而非二元相关性判断(粗粒度)。为缓解假阴性问题,在执行相关性标注时考虑了多样性更高的更多段落,尤其在测试集中,以确保更准确的评估。除文本查询与段落数据外,还提供了其他辅助资源,如查询类型及生成段落所属文档的 XML 文件,以促进进一步研究。为评估该数据集,我们在 T2Ranking 上实现并测试了常用排序模型作为基线。实验结果表明 T2Ranking 具有挑战性,且仍有改进空间。完整数据与所有代码见 https://github.com/THUIR/T2Ranking/
引用
@article{arxiv.2304.03679,
title = {T2Ranking: A large-scale Chinese Benchmark for Passage Ranking},
author = {Xiaohui Xie and Qian Dong and Bingning Wang and Feiyang Lv and Ting Yao and Weinan Gan and Zhijing Wu and Xiangsheng Li and Haitao Li and Yiqun Liu and Jin Ma},
journal= {arXiv preprint arXiv:2304.03679},
year = {2023}
}
备注
This Resource paper has been accepted by the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2023)