中文

用于说话人识别的分层注意力网络弱监督训练

音频与语音处理 2020-08-28 v3 计算与语言 声音

摘要

在不知晓录音中说话人声音位置的情况下识别多个说话人是一项具有挑战性的任务。本文提出一种分层注意力网络来解决弱标注的说话人识别问题。所采用的分层结构由帧级编码器和段级编码器组成,旨在局部与全局地学习说话人相关信息。语音流被分割为片段。带注意力的帧级编码器局部地学习特征并突出与目标相关的帧,输出基于片段的嵌入。段级编码器配合第二注意力层以强调可能与目标说话人相关的片段。最终从段级模块收集全局信息,通过分类器预测说话人。为评估所提方法的有效性,基于 Switchboard Cellular part1(SWBC)和 Voxceleb1 构建了两种条件下的人工数据集,其中说话人声音分别为重叠与非重叠。与两个基线相比,所得结果表明所提方法能取得更优性能。此外,进行了进一步实验以评估语句分割的影响。结果表明合理的分割可轻微提升识别性能。

关键词

引用

@article{arxiv.2005.07817,
  title  = {Weakly Supervised Training of Hierarchical Attention Networks for Speaker Identification},
  author = {Yanpei Shi and Qiang Huang and Thomas Hain},
  journal= {arXiv preprint arXiv:2005.07817},
  year   = {2020}
}

备注

Acceptted for presentation at Interspeech2020