中文

基于多视图的音视频目标说话人提取

音频与语音处理 2026-03-12 v2

摘要

音视频目标说话人提取(AVTSE)旨在利用对应的视觉线索从混合音频信号中分离出目标说话人的声音。虽然大多数现有的AVTSE方法仅依赖正面视角视频,但这一限制使其在现实场景中不够稳健,因为这些场景中常见非正面视角。这些视觉视角往往包含互补的发音信息,可用于增强语音提取。本文提出了一种新型框架——多视图张量融合(MVTF),将多视图学习转化为单视图性能提升。在训练阶段,我们利用同步的多视角口唇视频,通过MVTF学习跨视图关联性,其中成对的外积显式地建模了不同输入口唇嵌入视图之间的乘法互动。在推理阶段,系统支持单视图和多视图输入两种模式。实验结果表明,在单视图输入情况下, our框架利用多视图知识实现了显著的性能提升;而在多视图模式下,进一步提升了整体性能并增强了鲁棒性。我们的演示、代码和数据已在 https://anonymous.4open.science/w/MVTF-Gridnet-209C/ 提供。

关键词

引用

@article{arxiv.2603.07696,
  title  = {Multi-View Based Audio Visual Target Speaker Extraction},
  author = {Peijun Yang and Zhan Jin and Juan Liu and Ming Li},
  journal= {arXiv preprint arXiv:2603.07696},
  year   = {2026}
}

备注

submitted to Interspeech 2026