中文

从评论到对话:基于零样图LLM对话式推荐系统的主动数据合成

信息检索 2025-04-23 v1

摘要

对话式推荐系统(CRS)通常需要大量领域特定的对话数据集,但高成本、隐私顾虑和数据收集挑战严重限制了其可得性。虽然大语言模型(LLM)显示出强大的零样图推荐能力,但实际应用中往往更倾向于使用规模较小、由内部管理的推荐模型,因为这有利于提升可扩展性、可解释性和数据隐私,尤其是在敏感或快速变化的领域。然而,这些较小的模型仍需大量领域特定的对话数据才能有效训练,这仍然难以获得。为此,我们提出一种主动数据增强框架,通过利用黑箱LLM并借助主动学习技术来合成对话式训练数据。具体而言,我们的方法利用公开的非对话式领域数据,包括物品元数据、用户评论和协同信号,作为种子输入。通过采用主动学习策略选择最具信息性的种子样本,我们的方法高效地引导LLM生成针对目标领域的、语义连贯的合成对话互动。广泛的实验表明,我们提议的框架生成的对话数据显著提高了基于LLM的CRS模型性能,有效解决了在零资源或低资源场景中构建CRS的挑战。

关键词

引用

@article{arxiv.2504.15476,
  title  = {From Reviews to Dialogues: Active Synthesis for Zero-Shot LLM-based Conversational Recommender System},
  author = {Rohan Surana and Junda Wu and Zhouhang Xie and Yu Xia and Harald Steck and Dawen Liang and Nathan Kallus and Julian McAuley},
  journal= {arXiv preprint arXiv:2504.15476},
  year   = {2025}
}

备注

11 pages, 2 figures