探索长程上下文特征用于说话人验证
声音
2021-12-15 v1 音频与语音处理
摘要
捕获长程依赖并建模长时间上下文已被证明有益于说话人验证任务。本文中,我们提出将分层拆分块(HS-block)与深度可分离自注意力(DSSA)模块相结合,分别从局部和全局视角捕获更丰富的多范围上下文说话人特征。具体而言,HS-block 将特征图与滤波器拆分为若干组并在一个块中堆叠,从而在局部上扩大感受野(RFs)。DSSA 模块通过深度可分离策略与显式稀疏注意力策略改进多头自注意力机制,以在全局上建模两两关系,并在各通道中捕获有效的长程依赖。实验在 Voxceleb 与 SITW 上进行。我们的最佳系统通过结合 HS-block 与 DSSA 模块,在 Voxceleb1 测试集上取得 1.27% EER,在 SITW 上取得 1.56% EER。
引用
@article{arxiv.2112.07134,
title = {Explore Long-Range Context feature for Speaker Verification},
author = {Zhuo Li},
journal= {arXiv preprint arXiv:2112.07134},
year = {2021}
}
备注
rejected by interspeech2021