中文

ConvApparel:面向对话推荐系统用户模拟器的基准数据集与验证框架

计算与语言 2026-02-20 v1

摘要

基于 LLM 的用户模拟器以提升对话 AI 的前景,却因关键“现实差距”而受限,导致系统针对模拟交互进行优化,但可能在现实世界中难以实现。我们引入ConvApparel,一套新的人类-人工对话数据集,以解决这一差距。其独特的双代理数据收集协议——使用“好”和“坏”推荐器——实现反事实验证,通过捕获广泛的用户体验谱系,并包含用户满意度的一手注释。我们提出了综合性的验证框架,将统计对齐、人类似ness评分和反事实验证相结合,以测试泛化能力。我们的实验揭示了所有模拟器之间存在显著的现实差距。然而,该框架也表明,数据驱动的模拟器在反事实验证中优于提示基线,特别是在它们更真实地适应未见行为方面,表明它们拥有更稳健、尽管不完美的用户模型。

关键词

引用

@article{arxiv.2602.16938,
  title  = {ConvApparel: A Benchmark Dataset and Validation Framework for User Simulators in Conversational Recommenders},
  author = {Ofer Meshi and Krisztian Balog and Sally Goldman and Avi Caciularu and Guy Tennenholtz and Jihwan Jeong and Amir Globerson and Craig Boutilier},
  journal= {arXiv preprint arXiv:2602.16938},
  year   = {2026}
}

备注

EACL 2026