中文

面向会话级评估的会话级归一化与点击数据增强

信息检索 2024-01-24 v1

摘要

由于用户通常需要发出一系列查询并检查多个文档,以在搜索会话中解决复杂的信息需求,研究人员已高度关注在会话级别而非单查询级别评估搜索系统。大多数现有的会话级指标分别评估每个查询,然后使用会话级加权函数聚合查询级得分。这些指标背后的假设是,会话中的所有查询都应参与,且其顺序是固定的。然而,如果一个搜索系统能让用户对其前几个查询感到满意,她可能就不需要任何后续查询了。此外,在大多数真实世界的搜索场景中,由于缺乏真实用户的显式反馈,我们只能利用一些隐式反馈(如用户的点击)作为离线评估的相关性标签。这种隐式反馈可能与搜索会话中的真实相关性不同,因为某些文档可能在之前的查询中被遗漏,但在后来的查询重构中被识别出来。为了解决上述问题,我们对基于会话的评估提出了两个假设,明确描述了一个理想的会话搜索系统,以及如何在计算会话级评估指标时增强点击数据。基于我们的假设,我们设计了一个称为归一化 U 度量 (NUM) 的会话级指标。NUM 将会话作为一个整体进行评估,并利用一个理想会话对实际会话的结果进行归一化。此外,它基于隐式反馈推断会话级相关性标签。在两个公开数据集上的实验,通过将 NUM 与现有基于会话的指标在与用户满意度的相关性和直观性方面进行比较,证明了 NUM 的有效性。我们还进行了消融研究,以探讨这些假设是否成立。

关键词

引用

@article{arxiv.2401.12445,
  title  = {Session-level Normalization and Click-through Data Enhancement for Session-based Evaluation},
  author = {Haonan Chen and Zhicheng Dou and Jiaxin Mao},
  journal= {arXiv preprint arXiv:2401.12445},
  year   = {2024}
}