中文

SimEval-IR:一个用于评估用户模拟器与搜索会话的统一工具包与基准套件

信息检索 2026-05-01 v1

摘要

用户模拟器在交互式信息检索中日益成为核心,然而该领域缺乏标准化的评估工具。模拟器服务于两个目标:行为逼真度(匹配真实用户行为)和测试者可靠性(产生有效的系统排名),尽管这两个目标截然不同且有时相互冲突,但它们常常被混为一谈。我们提出了 SimEval-IR,一个开源工具包和基准套件,使这种区分变得可衡量。SimEval-IR 提供:(1)一个统一的会话模式,将会话搜索和对话交互统一起来,并配有经过验证的数据集适配器和显式的损失核算;(2)三个可执行的基准测试,涵盖行为逼真度、使用 RATE 式估计的测试者可靠性,以及将两者联系起来分析;(3)在两种语言的四个真实数据集和四个模拟器家族上的基线结果。我们的关键发现是:文献中占主导地位的逼真度测试——分类器-判别器“类人性”检查——对系统排名有效性的汇总预测能力基本为零(r=+0.09r{=}{+}0.09, n=48n{=}48),而基于会话嵌入的边际点击深度距离和 Fréchet 距离则给出了强得多的信号(r=0.43|r|{=}0.430.400.40, p0.005p{\leq}0.005)。SimEval-IR 已发布所有配置和脚本,以重现报告的分析。

关键词

引用

@article{arxiv.2604.27878,
  title  = {SimEval-IR: A Unified Toolkit and Benchmark Suite for Evaluating User Simulators and Search Sessions},
  author = {Saber Zerhoudi},
  journal= {arXiv preprint arXiv:2604.27878},
  year   = {2026}
}