中文

eMotions:面向短视频情感分析的大规模数据集与视听融合网络

计算机视觉与模式识别 2025-08-12 v1

摘要

短视频(SVs)已成为我们获取和分享信息的日常在线活动的重要组成部分。其多模态复杂性给视频分析带来了新的挑战,凸显了社区内对视频情感分析(VEA)的需求。鉴于短视频情感数据的有限可用性,我们引入了 eMotions,一个包含 27,996 个带有全尺度标注视频的大规模数据集。为确保质量并减少主观偏差,我们强调更好的人员分配,并提出了一种多阶段标注流程。此外,我们通过有针对性的采样提供了类别平衡和面向测试的变体,以满足多样化需求。尽管对具有清晰情感线索(如面部表情)的视频已有大量研究,但分析短视频中的情感仍是一项具有挑战性的任务。挑战源于更广泛的内容多样性,这引入了更显著的语义鸿沟,并使情感相关特征的表示学习复杂化。此外,短视频中视听共表达的普遍性导致了由情感表达不一致引起的局部偏差和集体信息鸿沟。为解决此问题,我们提出了 AV-CANet,一种端到端的视听融合网络,利用视频 Transformer 捕获语义相关的表示。我们进一步引入了局部-全局融合模块,旨在逐步捕获视听特征的相关性。此外,构建了 EP-CE 损失函数,通过三极惩罚全局引导优化。在三个 eMotions 相关数据集和四个公开 VEA 数据集上的大量实验证明了我们提出的 AV-CANet 的有效性,同时为未来研究提供了广泛的见解。此外,我们进行了消融研究以检验方法的关键组件。数据集和代码将在 Github 上公开。

关键词

引用

@article{arxiv.2508.06902,
  title  = {eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos},
  author = {Xuecheng Wu and Dingkang Yang and Danlei Huang and Xinyi Yin and Yifan Wang and Jia Zhang and Jiayu Nie and Liangyu Fu and Yang Liu and Junxiao Xue and Hadi Amirpour and Wei Zhou},
  journal= {arXiv preprint arXiv:2508.06902},
  year   = {2025}
}