VRAgent-R1:基于强化学习的多模态大语言模型智能体提升视频推荐
多媒体
2025-07-04 v1
摘要
凭借强大的自然语言处理和生成能力,大语言模型(LLM)智能体已成为通过用户模拟增强推荐系统的有前景的解决方案。然而,在视频推荐领域,现有研究主要采用基于提示的冻结LLM模拟,并面临多模态内容理解的复杂挑战。这通常导致次优的项目建模和用户偏好学习,从而最终限制了推荐性能。为应对这些挑战,我们引入了VRAgent-R1,一种新颖的基于智能体的范式,在用户模拟中融入类人智能。具体而言,VRAgent-R1包含两个不同的智能体:项目感知(IP)智能体和用户模拟(US)智能体,专为交互式用户-项目建模而设计。首先,IP智能体基于多模态大语言模型(MLLM)模拟类人的渐进式思维,有效捕获视频中隐藏的推荐语义。借助IP智能体提供的更全面的多模态内容理解,视频推荐系统能够提供更高质量的候选项目。随后,US智能体基于深入的思维链(CoT)推理优化推荐的视频集,并通过强化学习实现与真实用户偏好的更好对齐。在大型视频推荐基准上的实验结果表明,我们提出的VRAgent-R1方法具有有效性,例如,IP智能体在MicroLens-100k数据集上的NDCG@10提升了6.0%,而US智能体在用户决策模拟中的准确率相比最先进的基线高出约45.0%。
引用
@article{arxiv.2507.02626,
title = {VRAgent-R1: Boosting Video Recommendation with MLLM-based Agents via Reinforcement Learning},
author = {Siran Chen and Boyu Chen and Chenyun Yu and Yuxiao Luo and Ouyang Yi and Lei Cheng and Chengxiang Zhuo and Zang Li and Yali Wang},
journal= {arXiv preprint arXiv:2507.02626},
year = {2025}
}