中文

基于反向选择性听觉注意的视听目标说话人提取

音频与语音处理 2025-03-04 v3 声音

摘要

视听目标说话人提取(AV-TSE)旨在给定辅助视觉线索的情况下,从混合音频中提取特定人的语音。以往方法通常通过语音-唇语同步来搜索目标语音。然而,这种策略主要关注目标语音的存在,而忽略了噪声特性的变化,即干扰说话人和背景噪声。这可能导致在具有挑战性的声学环境中从错误声源提取含噪信号。为此,我们提出了一种新颖的选择性听觉注意机制,该机制可以抑制干扰说话人和非语音信号,以避免错误的说话人提取。通过该机制估计并利用不需要的含噪信号,我们设计了一个名为减法与提取网络(SEANet)的 AV-TSE 框架来抑制含噪信号。我们通过重新实现三种流行的 AV-TSE 方法作为基线,并采用九个评估指标,进行了大量实验。实验结果表明,我们提出的 SEANet 取得了 state-of-the-art 的结果,并且在所有五个数据集上均表现良好。代码可在:https://github.com/TaoRuijie/SEANet.git 找到

关键词

引用

@article{arxiv.2404.18501,
  title  = {Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention},
  author = {Ruijie Tao and Xinyuan Qian and Yidi Jiang and Junjie Li and Jiadong Wang and Haizhou Li},
  journal= {arXiv preprint arXiv:2404.18501},
  year   = {2025}
}