用于说话人确认的交叉注意力池化
音频与语音处理
2020-12-04 v2 声音
摘要
本文的目标是文本无关的说话人确认,其中语音片段来自“野外”视频且可能包含无关信号。虽然说话人确认本质上是一个成对问题,但现有生成说话人嵌入的方法都是逐实例的。本文提出交叉注意力池化(Cross Attentive Pooling, CAP),利用参考-查询对之间的上下文信息来生成话语级嵌入,其中包含对该成对匹配问题最具判别力的信息。实验在 VoxCeleb 数据集上进行,我们的方法优于可比较的池化策略。
引用
@article{arxiv.2008.05983,
title = {Cross attentive pooling for speaker verification},
author = {Seong Min Kye and Yoohwan Kwon and Joon Son Chung},
journal= {arXiv preprint arXiv:2008.05983},
year = {2020}
}
备注
SLT 2021. Code available at https://github.com/seongmin-kye/CAP