中文

基于 LLM 的多模态特征融合用于商业记忆度预测

计算机视觉与模式识别 2025-10-28 v1 人工智能 多媒体

摘要

本文聚焦于“Subtask 2: Commercial/Ad Memorability”任务,即“记忆力:预测电影和商业广告记忆力”在 MediaEval 2025 工作坊竞赛中的实现。我们提出一种多模态融合系统,采用 Gemma-3 LLM 作为 backbone,将预计算的视觉(ViT)和文本(E5)特征通过多模态投影进行整合。模型通过 Low-Rank Adaptation(LoRA)进行适配。梯度提升树的深度调优集成作为基线。关键贡献在于利用 LLM 生成的理性提示,这些提示基于专家提炼的记忆度方面进行引导。结果表明,LLM 基于系统在最终测试集上相较于基线具有更大的鲁棒性和泛化性能。本论文的代码可在 https://github.com/dsgt-arc/mediaeval-2025-memorability 查阅。

关键词

引用

@article{arxiv.2510.22829,
  title  = {LLM-based Fusion of Multi-modal Features for Commercial Memorability Prediction},
  author = {Aleksandar Pramov},
  journal= {arXiv preprint arXiv:2510.22829},
  year   = {2025}
}