ASDnB:融合面部与身体线索的稳健主动说话人检测
计算机视觉与模式识别
2024-12-12 v1
摘要
当前最先进的主动说话人检测(ASD)方法主要使用音频和面部特征作为输入。然而,本文的主要假设是身体动力学与“说话”(和“倾听”)动作高度相关,在野外条件下(例如监控环境)应尤其有用,其中无法可靠地获取面部信息。我们提出ASDnB,一种唯一集成面部与身体信息的模型,通过在特征提取的不同步骤中融合输入。我们的ethods 将3D卷积分解为2D和1D,以降低计算成本而不损失性能,并使用自适应权重特征重要性进行训练,以提高面部与身体数据的互补性。我们的实验表明,ASDnB在基准数据集(AVA-ActiveSpeaker)、具有挑战性的WASD数据集,以及使用Columbia进行跨域设置中均实现了最先进的结果。如此,ASDnB可以在多种设置下发挥作用,被视为稳健ASD模型的强基准(代码已公开:https://github.com/Tiago-Roxo/ASDnB)。
引用
@article{arxiv.2412.08594,
title = {ASDnB: Merging Face with Body Cues For Robust Active Speaker Detection},
author = {Tiago Roxo and Joana C. Costa and Pedro Inácio and Hugo Proença},
journal= {arXiv preprint arXiv:2412.08594},
year = {2024}
}