检索多样化视角的开放世界评估
计算与语言
2025-04-23 v2 信息检索
摘要
我们研究检索一组覆盖复杂且有争议问题(例如:ChatGPT 会不会造成更大危害?)的各种观点的文档集合。我们构建了一个针对主观问题检索多样性的基准数据集(BERDS),其中每个示例包含一个问题和与该问题相关的多样化观点,来源于调查问题和辩论网站。在此数据上,评估配合语料库的检索器,以呈现包含多样化观点的文档集合。我们的框架与大多数检索任务不同,文档相关性不能通过简单的字符串匹配来决定。相反,我们构建了一个基于语言模型的自动评估器,用于决定每个检索到的文档是否包含一个观点。这允许我们评估三种不同类型的语料库(维基百科、网页快照以及使用搜索引擎检索页面构建的动态语料库)配合检索器的性能。检索多样化文档仍然具有挑战性,现有检索器的输出在仅覆盖 40% 的示例时就能覆盖所有观点。我们进一步研究查询扩展和以多样性为导向的重新排序方法的有效性,并分析检索器的迎合现象。
引用
@article{arxiv.2409.18110,
title = {Open-World Evaluation for Retrieving Diverse Perspectives},
author = {Hung-Ting Chen and Eunsol Choi},
journal= {arXiv preprint arXiv:2409.18110},
year = {2025}
}