用于主动说话人检测的长时空间-时间图学习
计算机视觉与模式识别
2022-10-13 v3
摘要
在含多个说话人的视频中进行主动说话人检测(ASD)是一项具有挑战性的任务,因为它需要在长时时间窗上学习有效的视听特征及空间-时间相关性。本文中,我们提出 SPELL,一种可解决 ASD 等复杂任务的新颖空间-时间图学习框架。为此,视频帧中的每个人首先被编码为该帧的唯一节点。跨帧对应同一个人的节点被连接以编码其时间动态。帧内节点也被连接以编码人际间关系。因此,SPELL 将 ASD 归约为节点分类任务。重要的是,SPELL 能够对所有节点在长时时间上下文上进行推理,而无需依赖计算代价高昂的全连接图神经网络。通过在 AVA-ActiveSpeaker 数据集上的大量实验,我们证明学习基于图的表示因其显式的空间与时间结构可显著提升主动说话人检测性能。SPELL 优于所有先前的先进方法,同时所需内存与计算资源显著更低。我们的代码公开于 https://github.com/SRA2/SPELL
引用
@article{arxiv.2207.07783,
title = {Learning Long-Term Spatial-Temporal Graphs for Active Speaker Detection},
author = {Kyle Min and Sourya Roy and Subarna Tripathi and Tanaya Guha and Somdeb Majumdar},
journal= {arXiv preprint arXiv:2207.07783},
year = {2022}
}
备注
ECCV 2022 camera ready (Supplementary videos: on ECVA soon). This paper supersedes arXiv:2112.01479