中文

生成式探索-利用:基于 LLM 优化器的无训练生成式推荐系统优化方法

计算与语言 2024-06-11 v1 人工智能

摘要

推荐系统广泛用于提供引人入胜的内容,大型语言模型(LLM)的出现催生了生成式推荐系统。这些系统可以直接生成物品,包括用于开放集合任务(如问题建议)的物品生成。尽管 LLM 的世界知识能够提供良好的推荐,但通过用户反馈改进生成内容具有挑战性,因为持续微调 LLM 代价高昂。我们提出了一种无训练方法,用于优化生成式推荐系统,通过将用户反馈循环连接到基于 LLM 的优化器。我们提出了一种生成式探索-利用方法,不仅能利用已知高互动的生成物品,还能主动探索和发现隐藏的人口偏好,以提高推荐质量。我们在两个领域(电子商务和通用知识)上评估了该方法,用于问题生成,模型用户反馈使用点击通过率(CTR)。实验表明,我们的 LLM 基于探索-利用方法可以迭代地提高推荐效果,并持续增加 CTR。消融分析表明,生成式探索是学习用户偏好关键因素,避免了仅靠贪心利用方法的陷阱。人类评估强烈支持我们的量化结果。

关键词

引用

@article{arxiv.2406.05255,
  title  = {Generative Explore-Exploit: Training-free Optimization of Generative Recommender Systems using LLM Optimizers},
  author = {Lütfi Kerem Senel and Besnik Fetahu and Davis Yoshida and Zhiyu Chen and Giuseppe Castellucci and Nikhita Vedula and Jason Choi and Shervin Malmasi},
  journal= {arXiv preprint arXiv:2406.05255},
  year   = {2024}
}

备注

Accepted at ACL 2024 Main Proceedings