基于交互式思考推理的推荐增强框架:Reason-to-Recommend
信息检索
2025-06-10 v2 人工智能
摘要
受大型语言模型(LLMs)进步的驱动,由于其强大的语义理解能力和提示灵活性,将其集成到推荐任务中受到关注。以前的工作将用户-项目交互或元数据编码到提示中进行推荐。并行地,受测试时扩展和强化学习推动的LLM推理在数学和代码等领域表现卓越,由于推理痕迹和正确性信号清晰,实现了高性能和可解释性。然而,直接将这些推理方法应用于推荐任务是无效的,因为用户反馈是隐式的,缺乏推理监督。为此,我们提出了一种推荐推理增强框架R2Rec(Reason-to-Recommend),通过渐进式掩码提示策略从用户-项目图中抽取交互链,转换为结构化的交互式思考,通过每一步基于交互上下文的推理表示。这使LLMs能够基于隐式模式模拟逐步决策。我们设计了一个两阶段训练管道:监督微调教会基本推理来自高质量痕迹,强化学习通过奖励信号 refined 推理,缓解稀疏的显式监督。在三个真实数据集上的实验表明,R2Rec在HitRatio@1上平均超过经典和基于LLM的基线提升了10.48%,相对于原始LLM提升了131.81%。此外,显式的推理链通过揭示决策过程来增强可解释性。我们的代码可在https://anonymous.4open.science/r/R2Rec-7C5D获取。
引用
@article{arxiv.2506.05069,
title = {Reason-to-Recommend: Using Interaction-of-Thought Reasoning to Enhance LLM Recommendation},
author = {Keyu Zhao and Fengli Xu and Yong Li},
journal= {arXiv preprint arXiv:2506.05069},
year = {2025}
}