利用情感视觉信息对人体中心视频进行摘要
计算机视觉与模式识别
2021-07-09 v1 人机交互
摘要
用户生成的人体中心视频内容及其在视频检索与浏览等应用中的体量不断增长,需要紧凑的表示,这正是视频摘要文献所解决的问题。当前的监督研究将视频摘要表述为序列到序列的学习问题,现有方案常忽视人体中心视角中固有的、包含情感内容的激增。在本研究中,我们探讨针对人体中心视频的、融入情感信息的监督视频摘要任务。首先,我们在 RECOLA 数据集上训练了一个视觉输入驱动的先进连续情绪识别模型(CER-NET)以估计情绪属性。随后,我们将估计的情绪属性与来自 CER-NET 的高层表示同视觉信息相融合,定义所提出的情感视频摘要架构(AVSUM)。此外,我们探究利用注意力来改进 AVSUM 架构,并基于时间注意力(TA-AVSUM)与空间注意力(SA-AVSUM)提出了两种新架构。我们在 TvSum 数据库上进行了视频摘要实验。所提出的 AVSUM-GRU 架构(采用高层 GRU 嵌入的早期融合)与基于时间注意力的 TA-AVSUM 架构取得了有竞争力的视频摘要性能,相较于最先进水平,在 F-score 与自定义人脸召回(face recall)指标上对人体中心视频带来了显著的性能提升。
引用
@article{arxiv.2107.03783,
title = {Use of Affective Visual Information for Summarization of Human-Centric Videos},
author = {Berkay Köprü and Engin Erzin},
journal= {arXiv preprint arXiv:2107.03783},
year = {2021}
}
备注
12 pages