中文

多头自注意力中的时序-通道建模用于合成语音检测

声音 2024-09-10 v1 人工智能 音频与语音处理

摘要

最近的合成语音检测器利用 Transformer 模型取得了优于卷积神经网络对手的性能。这一改进可能归因于 Transformer 模型中多头自注意力(MHSA)的强大建模能力,它学习每个输入标记的时间关系。然而,合成语音的人工痕迹可能位于频率通道和时间段的特定区域,而 MHSA 却忽略了这种时序-通道依赖性。在本工作中,我们提出了时序-通道建模(TCM)模块,以增强 MHSA 捕获时序-通道依赖性的能力。在 ASVspoof 2021 数据集上的实验结果表明,仅凭 0.03M 的额外参数,TCM 模块能够以 9.25% 的 EER 提升超过最先进的系统。进一步的消融研究揭示,使用时序和通道信息可为检测合成语音提供最佳改进。

关键词

引用

@article{arxiv.2406.17376,
  title  = {Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection},
  author = {Duc-Tuan Truong and Ruijie Tao and Tuan Nguyen and Hieu-Thi Luong and Kong Aik Lee and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2406.17376},
  year   = {2024}
}

备注

Accepted by INTERSPEECH 2024