中文

迈向短视频情感分析:大规模数据集与基线模型

计算机视觉与模式识别 2024-12-10 v2 多媒体

摘要

如今,短视频(SVs)在日常网络信息获取与分享中不可或缺。短视频传播情感的普遍使用导致有必要对其开展视频情感分析(VEA)。考虑到短视频情感数据的缺失,我们引入一个名为 eMotions 的大规模数据集,包含 27,996 个视频。同时,我们通过更优的人员分配与多阶段标注来缓解主观性对标注质量的影响。此外,我们通过针对性数据采样提供类别平衡与面向测试的变体。一些常用视频(如面部表情)已被充分研究。然而,分析短视频中的情感仍具挑战性。因为更广的内容多样性带来了更显著的语义鸿沟及学习情感相关特征的困难,且在普遍视听共表达下由情感不一致引发的局部偏差与整体信息鸿沟。为应对这些挑战,我们提出一个端到端视听基线 AV-CANet,其采用视频 transformer 以更好地学习语义相关表示。我们进一步设计局部-全局融合模块以渐进捕获视听特征关联。随后引入 EP-CE Loss 引导模型优化。在七个数据集上的大量实验结果表明了 AV-CANet 的有效性,并为未来工作提供广泛见解。此外,我们通过消融研究考察了 AV-CANet 的关键组件。数据集与代码将很快完全开源。

关键词

引用

@article{arxiv.2311.17335,
  title  = {Towards Emotion Analysis in Short-form Videos: A Large-Scale Dataset and Baseline},
  author = {Xuecheng Wu and Heli Sun and Junxiao Xue and Jiayu Nie and Xiangyan Kong and Ruofan Zhai and Liang He},
  journal= {arXiv preprint arXiv:2311.17335},
  year   = {2024}
}