WASD:一个更真实场景下的活跃说话人检测数据集
计算机视觉与模式识别
2023-03-10 v1 声音
音频与语音处理
图像与视频处理
摘要
当前的活跃说话人检测(ASD)模型在 AVA-ActiveSpeaker(AVA)上仅利用声音与面部特征便取得了优异结果。尽管该方法适用于电影场景(AVA),但并不适合约束较少的条件。为揭示此局限,我们提出了 Wilder Active Speaker Detection(WASD)数据集,通过针对当前 ASD 的两个关键组件——音频与人脸——来增加难度。WASD 分为 5 类,从最优条件到监控设置,包含随音频与人脸数据战术性受损而递增的 ASD 挑战。我们选取最先进模型,并在 WASD 的两组上评估其性能:Easy(协作设置)与 Hard(音频和/或人脸被特异性退化)。结果显示:1)在 AVA 上训练的模型在 WASD Easy 组保持最先进性能,而在 Hard 组表现不佳,表明 2)AVA 与 Easy 数据间的相似性;以及 3)在 WASD 上训练并未将模型性能提升至 AVA 水平,尤其在音频受损与监控设置下。这表明 AVA 并未使模型准备好应对真实场景 ASD,且当前方法在处理此类条件时表现欠佳。所提数据集还包含身体数据标注,为 ASD 提供新来源,并可于 https://github.com/Tiago-Roxo/WASD 获取。
引用
@article{arxiv.2303.05321,
title = {WASD: A Wilder Active Speaker Detection Dataset},
author = {Tiago Roxo and Joana C. Costa and Pedro R. M. Inácio and Hugo Proença},
journal= {arXiv preprint arXiv:2303.05321},
year = {2023}
}