学习时空图用于主动说话人检测
计算机视觉与模式识别
2021-12-07 v2
摘要
我们通过一个名为 SPELL 的新框架解决主动说话人检测问题,该框架学习长程多模态图以编码音频与视觉数据之间的模态间关系。我们将主动说话人检测视为一个感知更长程依赖的节点分类任务。我们首先从视频构建图,使得每个节点对应一个人。在定义的时间窗口内,代表同一身份的节点之间共享边。同一视频帧内的节点也相互连接以编码人际交互。通过在 Ava-ActiveSpeaker 数据集上的大量实验,我们证明基于图的表示学习因其显式的空间与时间结构而显著提升了整体性能。SPELL 优于若干相关基线,并与最先进模型性能相当,同时所需计算成本降低一个数量级。
引用
@article{arxiv.2112.01479,
title = {Learning Spatial-Temporal Graphs for Active Speaker Detection},
author = {Sourya Roy and Kyle Min and Subarna Tripathi and Tanaya Guha and Somdeb Majumdar},
journal= {arXiv preprint arXiv:2112.01479},
year = {2021}
}
备注
10 pages