中文

对偶时间-通道-频率注意力增强的说话人表征学习

声音 2021-10-18 v3 音频与语音处理

摘要

基于 CNN 的说话人表征网络中使用通道注意力已在说话人验证(SV)中取得显著性能。但这些方法在时间维和频率特征图上做简单平均后再进行通道注意力学习,忽略了时间、通道以及频率尺度之间本质的相互交互。为解决该问题,我们提出对偶时间-通道-频率(DTCF)注意力,借助时间和频率维度上全局上下文的聚合来重新校准通道特征。具体而言,对偶注意力——时间-通道(T-C)注意力以及频率-通道(F-C)注意力——旨在关注沿 T-C 和 F-C 特征图的显著区域,这些区域可能对全局上下文有更显著影响,从而产生更具判别性的说话人表征。我们在 CN-Celeb 和 VoxCeleb 数据集上评估了所提 DTCF 注意力的有效性。在 CN-Celeb 评估集上,ResNet34-DTCF 的 EER/minDCF 相比 ResNet34-SE 降低了 0.63%/0.0718。在 VoxCeleb1-O、VoxCeleb1-E 和 VoxCeleb1-H 评估集上,ResNet34-DTCF 的 EER/minDCF 相比 ResNet34-SE 分别实现了 0.36%/0.0263、0.39%/0.0382 和 0.74%/0.0753 的降低。

关键词

引用

@article{arxiv.2110.06565,
  title  = {Duality Temporal-channel-frequency Attention Enhanced Speaker Representation Learning},
  author = {Li Zhang and Qing Wang and Lei Xie},
  journal= {arXiv preprint arXiv:2110.06565},
  year   = {2021}
}