中文

用于从多说话人录音中提取说话人嵌入的递归注意力池化

音频与语音处理 2024-09-02 v1 声音

摘要

本文提出了一种从包含多个说话人的变长录音中为每个说话人提取说话人嵌入的方法。说话人嵌入不仅对说话人识别至关重要,而且对于各种多说话人语音应用(如说话人日志和目标说话人语音处理)也至关重要。尽管在多说话人场景中,在没有预先注册的情况下获取单个说话人语音面临挑战,但大多数关于说话人嵌入提取的研究集中在仅从单说话人录音中提取嵌入。已经提出了一些直接从多说话人录音中提取说话人嵌入的方法,但它们通常需要为每种可能的说话人数量准备一个模型,或者涉及复杂的训练过程。所提出的方法通过关注从输入多说话人音频中提取的逐帧嵌入的不同部分来计算多个说话人的嵌入。这是通过递归计算用于池化逐帧嵌入的注意力权重来实现的。此外,我们提出使用计算出的注意力权重来估计录音中的说话人数量,这允许将同一模型应用于不同数量的说话人。实验评估证明了所提出的方法在说话人验证和日志任务中的有效性。

关键词

引用

@article{arxiv.2408.17142,
  title  = {Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings},
  author = {Shota Horiguchi and Atsushi Ando and Takafumi Moriya and Takanori Ashihara and Hiroshi Sato and Naohiro Tawara and Marc Delcroix},
  journal= {arXiv preprint arXiv:2408.17142},
  year   = {2024}
}

备注

Accepted to IEEE SLT 2024