中文

行为对齐:评估基于 LLM 的对话式推荐系统的新视角

信息检索 2024-10-21 v2 人工智能

摘要

大型语言模型(Large Language Models, LLMs)在对话式推荐系统(Conversational Recommender Systems, CRS)中展现出巨大的潜力。然而,LLM 应用于 CRS 的应用暴露了LLM-based CRS与人类推荐员之间行为的显著差异:LLM往往显得不够灵活和被动,频繁地匆忙完成推荐任务而不足够询问。这种行为差异可能导致推荐准确性下降和用户满意度降低。尽管这一问题至关重要,但现有的CRS研究缺乏对如何衡量此类行为差异的研究。为填补这一空白,我们提出了行为对齐(Behavior Alignment),一种用于衡量LLM-based CRS推荐策略与人类推荐员一致性的新评估指标。我们的实验结果表明,新指标更符合人类偏好,能够更好地区分系统的性能。由于行为对齐需要对推荐策略进行显式且代价高昂的人类标注,我们还提出了一种基于响应的分类方法来隐式地衡量行为对齐。评估结果确认了该方法的鲁棒性。

关键词

引用

@article{arxiv.2404.11773,
  title  = {Behavior Alignment: A New Perspective of Evaluating LLM-based Conversational Recommender Systems},
  author = {Dayu Yang and Fumian Chen and Hui Fang},
  journal= {arXiv preprint arXiv:2404.11773},
  year   = {2024}
}

备注

Accepted by the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval