中文

你的模拟器有多可靠?对当前基于LLM的对话推荐用户模拟器局限性的分析

人工智能 2024-03-26 v1

摘要

对话推荐系统(CRS)通过自然语言与用户交互,以理解其偏好并提供实时个性化推荐。CRS已展现出巨大潜力,促使研究人员将开发更真实、更可靠的用户模拟器作为关键焦点。近来,大型语言模型(LLMs)的能力在多个领域引起了广泛关注。同时,基于LLM构建用户模拟器的努力也在进行中。虽然这些工作展示了创新性,但也伴随着一些需要关注的局限性。在本工作中,我们旨在分析在构建CRS用户模拟器时使用LLM的局限性,以指导未来研究。为实现这一目标,我们对一项值得关注的工作iEvaLM进行了分析验证。通过在对话推荐领域两个广泛使用的数据集上进行多项实验,我们指出了当前基于LLM的用户模拟器评估方法存在的若干问题:(1)数据泄露,发生在对话历史和用户模拟器的回复中,导致评估结果虚高。(2)CRS推荐的成功更多地取决于对话历史的可用性和质量,而非用户模拟器的响应。(3)通过单一提示模板控制用户模拟器的输出被证明具有挑战性。为克服这些局限性,我们提出了SimpleUserSim,采用一种简单的策略将话题引导至目标物品。我们的研究验证了CRS模型利用交互信息的能力,显著改善了推荐结果。

关键词

引用

@article{arxiv.2403.16416,
  title  = {How Reliable is Your Simulator? Analysis on the Limitations of Current LLM-based User Simulators for Conversational Recommendation},
  author = {Lixi Zhu and Xiaowen Huang and Jitao Sang},
  journal= {arXiv preprint arXiv:2403.16416},
  year   = {2024}
}