STNet:用于鲁棒说话人跟踪的深度音视频融合网络
计算机视觉与模式识别
2024-10-10 v1 人工智能
摘要
音视频说话人跟踪旨在利用多传感器平台捕获的信号确定场景中人类目标的位置,多模态融合方法可以提高其准确性和鲁棒性。近年来,已有多种融合方法被提出用于建模多模态间的相关性。然而,对于说话人跟踪问题,音频和视觉信号之间的跨模态交互尚未得到充分利用。为此,本文提出了一种新颖的说话人跟踪网络(STNet),其中包含一个深度音视频融合模型。我们设计了一种视觉引导的声学测量方法,在统一的定位空间中融合异质线索,该方法通过相机模型利用视觉观测来构建增强的声学图。对于特征融合,采用跨模态注意力模块来联合建模多模态上下文和交互。音频和视觉特征之间的相关信息在融合模型中进一步交互。此外,基于STNet的跟踪器通过一个质量感知模块应用于多说话人场景,该模块评估多模态观测的可靠性,以在复杂场景中实现鲁棒跟踪。在AV16.3和CAV3D数据集上的实验表明,所提出的基于STNet的跟踪器优于单模态方法和最先进的音视频说话人跟踪器。
引用
@article{arxiv.2410.05964,
title = {STNet: Deep Audio-Visual Fusion Network for Robust Speaker Tracking},
author = {Yidi Li and Hong Liu and Bing Yang},
journal= {arXiv preprint arXiv:2410.05964},
year = {2024}
}