中文

面向稀疏重叠多说话人语音的音视频活跃说话人提取

声音 2023-09-18 v1 音频与语音处理

摘要

目标说话人提取旨在从多说话人混合语音中按辅助参考指定提取特定说话人的语音。多数研究聚焦于目标语音与干扰语音高度重叠的场景。然而,该场景仅占真实世界对话的很小比例。本文中,我们面向稀疏重叠场景,其中辅助参考需同时执行两项任务:检测目标说话人的活跃性,并从任何干扰语音中分离出活跃语音。我们提出了一种名为ActiveExtract的音视频说话人提取模型,其利用来自音视频活跃说话人检测(ASD)的说话活跃性。ASD直接提供目标说话人的帧级活跃性,而其中间特征表示经训练可判别用于说话人分离的语音-唇同步。实验结果表明,我们的模型在各种重叠比下均优于基线,在SI-SNR方面实现了超过4 dB的平均提升。

关键词

引用

@article{arxiv.2309.08408,
  title  = {Audio-Visual Active Speaker Extraction for Sparsely Overlapped Multi-talker Speech},
  author = {Junjie Li and Ruijie Tao and Zexu Pan and Meng Ge and Shuai Wang and Haizhou Li},
  journal= {arXiv preprint arXiv:2309.08408},
  year   = {2023}
}

备注

Submitted to ICASSP 2024