基于全局-局部蒸馏的音视频说话人跟踪网络——面向缺失模态情形
摘要
在说话人跟踪研究中,集成和补充多模态数据是提高跟踪系统准确性和鲁棒性的关键策略。然而,由于遮挡、声学噪声和传感器故障导致的噪声观测,缺失模态下的跟踪仍是一个具有挑战性的问题。尤其是在多个模态数据缺失时,现有的多模态融合方法的性能倾向于下降。为此,我们提出了一种基于全局-局部蒸馏的跟踪器(GLDTracker),实现对不完整信息的鲁棒音视频说话人跟踪。GLDTracker 采用教师-学生蒸馏模型驱动,实现对每个模态缺失信息的灵活融合。教师网络处理由摄像头阵列和麦克风阵列捕获的全局信号,而学生网络处理受视觉遮挡和缺失音频通道影响的局部信息。通过将知识从教师网络传递给学生网络,学生网络能够更好地适应信息不完整的复杂动态场景。在学生网络中,我们构建了一个基于生成对抗网络的全局特征重建模块,用于从缺失局部信息的特征嵌入中重建全局特征。此外,我们引入多模态多层融合注意力机制,将不完整特征与重建特征相融合,利用音视频和全局-局部特征的互补性与一致性。在 AV16.3 数据集上的实验结果表明,所提出的 GLDTracker 优于现有最先进的音视频跟踪方法,在标准数据集和不完整模态数据集上均实现领先性能,凸显了其在复杂条件下的优势与鲁棒性。该代码和模型将提供。
关键词
引用
@article{arxiv.2408.14585,
title = {Global-Local Distillation Network-Based Audio-Visual Speaker Tracking with Incomplete Modalities},
author = {Yidi Li and Yihan Li and Yixin Guo and Bin Ren and Zhenhuan Xu and Hao Guo and Hong Liu and Nicu Sebe},
journal= {arXiv preprint arXiv:2408.14585},
year = {2025}
}
备注
We request to withdraw our paper from arXiv due to unresolved author disagreements about the data interpretation and study conclusions. To maintain scientific integrity, we believe withdrawing the paper is necessary. We regret any confusion caused