中文

基于多模态Transformer特征融合的电影推荐系统注意力机制

信息检索 2024-07-15 v1 人工智能 机器学习

摘要

预训练模型从大型数据集中学习通用表征,可通过微调以针对特定任务显著减少训练时间。诸如生成式预训练变换器(GPT)、双向编码器表示变换器(BERT)和视觉变换器(ViT)的预训练模型已成为当前机器学习研究的基石。本研究提出一种多模态电影推荐系统,通过提取每部电影精心设计的海报特征以及电影叙事文本描述的特征。该系统使用BERT模型提取文本模态信息,应用ViT模型提取海报/图像模态信息,并使用Transformer体系结构对所有模态的特征进行融合,以预测用户偏好。将预训练基础模型与较小的数据集集成到下游应用中,可更全面地捕获多模态内容特征,从而提供更准确的推荐。通过标准基准问题中的MovieLens 100K和1M数据集验证了该 proof-of-concept模型的效率。与基线算法相比,用户评分预测准确度得到提升,从而展示了这种跨模态算法可被应用于电影或视频推荐的潜力。

关键词

引用

@article{arxiv.2407.09157,
  title  = {Movie Recommendation with Poster Attention via Multi-modal Transformer Feature Fusion},
  author = {Linhan Xia and Yicheng Yang and Ziou Chen and Zheng Yang and Shengxin Zhu},
  journal= {arXiv preprint arXiv:2407.09157},
  year   = {2024}
}