中文

VoiceVector:面向说话人分离的多模态登记向量

音频与语音处理 2025-01-03 v1

摘要

我们提出了一种基于转换器的语音分离架构,用于从多个说话人和环境噪声中分离出目标说话人的语音。我们通过两种独立的神经网络实现:(A) 一个设计用于制作说话人特定嵌入的登记网络,利用各种组合的音频和视觉模态;以及 (B) 一个接受噪声信号和登记向量作为输入,输出目标说话人干净信号的分离网络。我们的创新点包括:(i) 登记向量可以由音频alone、音频-视觉数据(使用唇部动作)或视觉数据alone(使用静默视频中的唇部动作)产生;以及 (ii) 在多个正向和负向登记向量上进行分离条件的灵活性。我们与以前的方法进行比较,取得了优异的性能。

关键词

引用

@article{arxiv.2501.01401,
  title  = {VoiceVector: Multimodal Enrolment Vectors for Speaker Separation},
  author = {Akam Rahimi and Triantafyllos Afouras and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2501.01401},
  year   = {2025}
}