中文

用于视频中时序情感定位的带跨模态共识的扩张上下文融合网络

计算机视觉与模式识别 2022-08-04 v1

摘要

理解人类情感是智能机器人提供更好人机交互的关键能力。现有工作局限于裁剪后视频级别的表情分类,无法定位与情感对应的时间窗口。本文引入一项新任务,称为视频中的时序情感定位(TEL),旨在未裁剪视频及对齐字幕中检测人类情感并定位其对应的时间边界。与时序动作定位相比,TEL 具有三个独特挑战:1)情感具有极其多变的时间动态;2)情感线索嵌入于外观与复杂情节之中;3)细粒度时间标注复杂且费力。为应对前两个挑战,我们提出一种具有粗细双流架构的新颖扩张上下文融合网络。粗流通过建模多粒度时间上下文来捕获多变的时间动态。细流通过推理来自粗流的多粒度时间上下文之间的依赖关系并将其自适应地整合为细粒度视频片段特征来实现复杂情节理解。为应对第三个挑战,我们引入跨模态共识学习范式,利用对齐视频与字幕之间的固有语义共识实现弱监督学习。我们贡献了一个包含 3,000 个手动标注时间边界的新测试集,以便未来关于 TEL 问题的研究可进行定量评估。大量实验表明我们的方法在时序情感定位上的有效性。本工作的代码库位于 https://github.com/YYJMJC/Temporal-Emotion-Localization-in-Videos。

关键词

引用

@article{arxiv.2208.01954,
  title  = {Dilated Context Integrated Network with Cross-Modal Consensus for Temporal Emotion Localization in Videos},
  author = {Juncheng Li and Junlin Xie and Linchao Zhu and Long Qian and Siliang Tang and Wenqiao Zhang and Haochen Shi and Shengyu Zhang and Longhui Wei and Qi Tian and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2208.01954},
  year   = {2022}
}

备注

Accepted by ACM Multimedia 2022