基于 LLM 的多模态特征融合用于商业记忆度预测
计算机视觉与模式识别
2025-10-28 v1 人工智能
多媒体
摘要
本文聚焦于“Subtask 2: Commercial/Ad Memorability”任务,即“记忆力:预测电影和商业广告记忆力”在 MediaEval 2025 工作坊竞赛中的实现。我们提出一种多模态融合系统,采用 Gemma-3 LLM 作为 backbone,将预计算的视觉(ViT)和文本(E5)特征通过多模态投影进行整合。模型通过 Low-Rank Adaptation(LoRA)进行适配。梯度提升树的深度调优集成作为基线。关键贡献在于利用 LLM 生成的理性提示,这些提示基于专家提炼的记忆度方面进行引导。结果表明,LLM 基于系统在最终测试集上相较于基线具有更大的鲁棒性和泛化性能。本论文的代码可在 https://github.com/dsgt-arc/mediaeval-2025-memorability 查阅。
引用
@article{arxiv.2510.22829,
title = {LLM-based Fusion of Multi-modal Features for Commercial Memorability Prediction},
author = {Aleksandar Pramov},
journal= {arXiv preprint arXiv:2510.22829},
year = {2025}
}