中文

$C^2$AV-TSE:基于上下文与置信度的音视频目标说话人提取

声音 2025-04-02 v1 机器学习 多媒体 音频与语音处理

摘要

音视频目标说话人提取(Audio-Visual Target Speaker Extraction, AV-TSE)旨在模拟人类利用视觉线索增强听觉感知的能力。虽然最近提出了许多模型,但大多数模型主要依赖声学特征中的局部依赖关系,未充分利用人类通过上下文信息推断说话不清部分的能力。这一局限导致不仅性能次优,而且在说话过程中提取质量不一致,某些片段表现不佳或对干扰说话人抑制不足。为弥合这一差距,我们提出了一种称为掩码-恢复(Mask-And-Recover, MAR)的模型无关策略,将其整合了跨模态和模内上下文相关性,以在提取模块中实现全局推断。此外,为更好地针对每个样本中具有挑战性的部分,我们引入了细粒度置信度评分(Fine-grained Confidence Score, FCS)模型,以评估提取质量并指导提取模块在低质量片段上强化改进。为验证所提出的模型无关训练范式的有效性,我们在 VoxCeleb2 数据集上采用了六种流行的 AV-TSE 主干模型,结果在各种指标上均表现出一致的性能提升。

关键词

引用

@article{arxiv.2504.00750,
  title  = {$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction},
  author = {Wenxuan Wu and Xueyuan Chen and Shuai Wang and Jiadong Wang and Lingwei Meng and Xixin Wu and Helen Meng and Haizhou Li},
  journal= {arXiv preprint arXiv:2504.00750},
  year   = {2025}
}

备注

Accepted by IEEE Journal of Selected Topics in Signal Processing (JSTSP)