面向基于 TDNN 的说话人验证的关键上下文信息有效建模
音频与语音处理
2025-09-15 v1
摘要
如今,时延神经网络(TDNN)已成为说话人验证任务的主流架构,其中 ECAPA-TDNN 是最先进的模型之一。当前致力于改进 TDNN 的工作主要解决 TDNN 在全局信息建模方面的局限性,并弥合 TDNN 与二维卷积之间的差距。然而,ECAPA-TDNN 提出的 SE-Res2Block 中的分层卷积结构无法充分利用上下文信息,导致 ECAPA-TDNN 建模有效上下文依赖的能力较弱。为此,提出了三种基于 ECAPA-TDNN 的改进架构,以充分有效地提取具有上下文依赖的多尺度特征并聚合这些特征。在 VoxCeleb 和 CN-Celeb 上的实验结果验证了所提出的三种架构的有效性。其中一种架构在 VoxCeleb1-O 数据集上的等错误率比 ECAPA-TDNN 降低了近 23%,证明了在可比的参数量下,当前 TDNN 架构中可实现的具有竞争力的性能。
引用
@article{arxiv.2509.09932,
title = {Effective Modeling of Critical Contextual Information for TDNN-based Speaker Verification},
author = {Shilong Weng and Liu Yang and Ji Mao},
journal= {arXiv preprint arXiv:2509.09932},
year = {2025}
}
备注
5 pages, 3 figures