重新思考音视同步在主动说话人检测中的作用
声音
2022-07-12 v2 人工智能
计算机视觉与模式识别
多媒体
音频与语音处理
摘要
主动说话人检测(ASD)系统是分析多说话人对话的重要模块。其旨在检测任意给定时刻视觉场景中哪些说话人或无人正在说话。现有 ASD 研究对主动说话人的定义尚未统一。我们在本工作中澄清了该定义,并要求音频与视觉说话活动之间同步。这一定义的澄清源于我们的广泛实验,通过实验我们发现现有 ASD 方法未能对音视同步建模,且常将不同步视频分类为主动说话。为解决此问题,我们提出一种跨模态对比学习策略,并在注意力模块中应用位置编码,以使有监督 ASD 模型利用同步线索。实验结果表明,我们的模型能成功将不同步说话检测为非说话,从而弥补了当前模型的局限。
引用
@article{arxiv.2206.10421,
title = {Rethinking Audio-visual Synchronization for Active Speaker Detection},
author = {Abudukelimu Wuerkaixi and You Zhang and Zhiyao Duan and Changshui Zhang},
journal= {arXiv preprint arXiv:2206.10421},
year = {2022}
}
备注
Accepted by IEEE International Workshop on Machine Learning for Signal Processing (MLSP 2022)