中文

ViLLA-MMBench:用于 LLM 增强多模态电影推荐的统一基准套件

信息检索 2025-08-07 v1

摘要

长形式视频内容的推荐需要对视觉、音频和文本三种模态进行联合建模,但大多数基准测试仅处理原始特征或局部融合。我们提出 ViLLA-MMBench,一个可复现、可扩展的 LLM 增强型多模态电影推荐基准。基于 MovieLens 和 MMTF-14K,对三种模态的稠密物品嵌入进行对齐:音频(块级 i-vector)、视觉(CNN、AVF)和文本。通过基于最新 LLM(如 OpenAI Ada)自动丰富稀疏或缺失的元数据,为数千部电影生成高质量剧情简介。所有文本(原始或增强)均可通过可配置编码器(Ada、LLaMA-2、Sentence-T5)嵌入,产生多个即插即用的数据集。该管道支持可替换的早期、中期和晚期融合(拼接、PCA、CCA、秩聚合),并支持多种 backbone(MF、VAECF、VBPR、AMR、VMF)进行消融实验。实验通过单个 YAML 文件全程声明化。评估指标涵盖准确度(Recall、nDCG)及超准确度指标:冷启动率、覆盖率、新颖性、多样性、公平性。结果表明,LLM 基于的数据增强和强文本嵌入显著提升冷启动和覆盖率,尤其在与音视频特征融合时效果更佳。系统化基准测试揭示了通用性与特定 backbone 或度量组合之间的关系。开源代码、嵌入和配置 enable 可复现、公平的多模态推荐系统研究,推动大规模推荐系统中原则性生成式 AI 集成。Code: https://recsys-lab.github.io/ViLLA-MMBench

关键词

引用

@article{arxiv.2508.04206,
  title  = {ViLLA-MMBench: A Unified Benchmark Suite for LLM-Augmented Multimodal Movie Recommendation},
  author = {Fatemeh Nazary and Ali Tourani and Yashar Deldjoo and Tommaso Di Noia},
  journal= {arXiv preprint arXiv:2508.04206},
  year   = {2025}
}

备注

17 pages, 3 figures, 5 tables