中文

LoCoNet:用于活跃说话人检测的长短期上下文网络

计算机视觉与模式识别 2024-04-02 v2

摘要

活跃说话人检测(ASD)旨在识别视频每一帧中谁在说话。ASD从两种上下文的音频与视觉信息进行推理:长期说话人内上下文与短期说话人间上下文。长期说话人内上下文对同一个说话人的时间依赖关系建模,而短期说话人间上下文对同一场景中说话人的交互建模。这两种上下文互为补充,可帮助推断活跃说话人。受这些观察启发,我们提出LoCoNet,一个简单而有效的长短期上下文网络,对长期说话人内上下文与短期说话人间上下文进行建模。我们使用自注意力对长期说话人内上下文建模,因其在建模长距离依赖上的有效性,并使用捕获局部模式的卷积块对短期说话人间上下文建模。大量实验表明,LoCoNet在多个数据集上取得了最先进的性能,在AVA-ActiveSpeaker上达到95.2%(+1.1%)的mAP,在Columbia数据集上达到68.1%(+22%),在Talkies数据集上达到97.2%(+2.8%),在Ego4D数据集上达到59.7%(+8.0%)。此外,在多个说话人同时存在或活跃说话人面部远小于同场景其他面部的挑战性情况下,LoCoNet在AVA-ActiveSpeaker数据集上超越先前最先进方法3.4%。代码将发布于https://github.com/SJTUwxz/LoCoNet_ASD。

关键词

引用

@article{arxiv.2301.08237,
  title  = {LoCoNet: Long-Short Context Network for Active Speaker Detection},
  author = {Xizi Wang and Feng Cheng and Gedas Bertasius and David Crandall},
  journal= {arXiv preprint arXiv:2301.08237},
  year   = {2024}
}

备注

accepted by CVPR 2024