中文

大语言模型时代对话式推荐系统评估的再思考

计算与语言 2024-06-21 v2 信息检索

摘要

大语言模型(LLMs)近期的成功展示了开发更强大的对话式推荐系统(CRSs)的巨大潜力,这类系统依赖自然语言对话来满足用户需求。本文对 ChatGPT 在对话式推荐中的使用展开调研,揭示了现有评估协议的不足:它可能过度强调与人工标注者生成的目标物品或话语的匹配,而忽视了作为合格 CRS 应具备的交互本质。为克服该局限,我们进一步提出一种基于 LLM 的名为 iEvaLM 的交互式评估方法,其利用基于 LLM 的用户模拟器。我们的评估方法能够模拟用户与系统之间的多种交互场景。通过在两个公开可用的 CRS 数据集上的实验,我们展示了相较于主流评估协议的显著改进。此外,我们强调可解释性的评估,ChatGPT 在其推荐中展现出具有说服力的解释生成能力。本研究有助于更深入理解 LLM 在 CRS 中尚未发掘的潜力,并为未来研究提供一个更灵活、易用的评估框架。代码与数据已公开于 https://github.com/RUCAIBox/iEvaLM-CRS。

关键词

引用

@article{arxiv.2305.13112,
  title  = {Rethinking the Evaluation for Conversational Recommendation in the Era of Large Language Models},
  author = {Xiaolei Wang and Xinyu Tang and Wayne Xin Zhao and Jingyuan Wang and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2305.13112},
  year   = {2024}
}

备注

Accepted by EMNLP 2023