具有情感感知多次注册融合的鲁棒音视频目标说话人提取
音频与语音处理
2026-03-12 v3 声音
摘要
音视频目标说话人提取(AVTSE)对于鸡尾酒会场景至关重要。利用多种线索——如话语级说话人嵌入或稳定的人脸图像,以及帧级唇部运动或面部表情特征——可以显著提高性能。然而,现实应用中经常出现间歇性信号丢失,尤其是帧级线索。本文系统研究了不同模态缺失程度下多次注册融合的鲁棒性。结果表明,虽然完全多模态融合在理想条件下表现优异,但在测试期间遇到未见过的模态缺失时,其性能急剧下降。关键在于,以高缺失率进行训练可大幅增强鲁棒性,即使在严重的测试时模态缺失下也能保持稳定的性能。我们证明,将互补的单帧人脸图像与帧级唇部特征相融合,可在 AVTSE 任务中同时实现出色的性能和鲁棒性。模型和代码已共享。
引用
@article{arxiv.2509.12583,
title = {Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion},
author = {Zhan Jin and Bang Zeng and Peijun Yang and Jiarong Du and Wei Ju and Yao Tian and Juan Liu and Ming Li},
journal= {arXiv preprint arXiv:2509.12583},
year = {2026}
}
备注
submitted to Interspeech 2026