中文

通过视听学习:让视觉语言模型理解艺术情感

计算机视觉与模式识别 2025-12-02 v2

摘要

情感理解是使大语言模型(LLM)更加通用、可靠且符合人类期望的关键。艺术通过视觉与听觉元素的联合设计来表达情感,但大多数现有研究是人类中心的或单模态的,忽略艺术品刻意表达的情感。与此同时,当前的音视频语言模型(AVLMs)通常需要大规模音频预训练才能为视觉语言模型(VLMs)提供听觉能力,这限制了其可扩展性。我们提出了Vision Anchored Audio-Visual Emotion LLM(VAEmotionLLM),一个两阶段框架,教会VLMs通过观看来“听见”,并在有限音频预训练的情况下理解跨模态情感。在阶段1中,Vision-Guided Audio Alignment(VG-Align)通过在同步音视频剪辑上对共享LLM的下一个标记分布进行对齐,将冻结的视觉路径蒸馏到新的音频路径,从而实现无需大型音频数据集的听觉能力。在阶段2中,一个轻量级的跨模态情感适配器(EmoAdapter),由情感增强器和情感监督者组成,将情感敏感的残差注入并应用情感监督,以增强跨模态情感理解。我们还构建了ArtEmoBenchmark,一个以艺术为中心的情感基准,评估内容和情感理解在音频-only、视觉-only和音频-视觉输入下的表现。VAEmotionLLM在ArtEmoBenchmark上实现了最先进的成绩,优于音频-only、视觉-only和音频-视觉基线方法。消融实验表明,所提方法的各个组件是互补的。

关键词

引用

@article{arxiv.2511.12077,
  title  = {Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound},
  author = {Dengming Zhang and Weitao You and Jingxiong Li and Weishen Lin and Wenda Shi and Xue Zhao and Heda Zuo and Junxian Wu and Lingyun Sun},
  journal= {arXiv preprint arXiv:2511.12077},
  year   = {2025}
}