中文

一种用于主动说话人检测的轻量模型

计算机视觉与模式识别 2023-03-09 v1 声音 音频与语音处理

摘要

主动说话人检测是音视频场景理解中的一项具有挑战性的任务,旨在检测一个或多个说话人场景中谁正在说话。由于该任务在说话人日志、说话人跟踪和自动视频编辑等应用中至关重要,已受到广泛关注。现有研究试图通过输入多个候选信息并设计复杂模型来提升性能。尽管这些方法取得了优异表现,但其对内存与算力的高消耗使得它们难以应用于资源受限场景。因此,我们通过减少输入候选、拆分2D与3D卷积以进行音视频特征提取,并应用低计算复杂度的门控循环单元(GRU)进行跨模态建模,构建了轻量级的主动说话人检测架构。在AVA-ActiveSpeaker数据集上的实验结果表明,我们的框架取得了具有竞争力的mAP性能(94.1%对比94.2%),而资源消耗显著低于最先进方法,尤其在模型参数(1.0M对比22.5M,约23倍)和FLOPs(0.6G对比2.6G,约4倍)方面。此外,我们的框架在Columbia数据集上也表现良好,展现出优良的鲁棒性。代码与模型权重见 https://github.com/Junhua-Liao/Light-ASD。

关键词

引用

@article{arxiv.2303.04439,
  title  = {A Light Weight Model for Active Speaker Detection},
  author = {Junhua Liao and Haihan Duan and Kanghui Feng and Wanbing Zhao and Yanbing Yang and Liangyin Chen},
  journal= {arXiv preprint arXiv:2303.04439},
  year   = {2023}
}

备注

Accepted by CVPR 2023