多头自注意力中的时序-通道建模用于合成语音检测
声音
2024-09-10 v1 人工智能
音频与语音处理
摘要
最近的合成语音检测器利用 Transformer 模型取得了优于卷积神经网络对手的性能。这一改进可能归因于 Transformer 模型中多头自注意力(MHSA)的强大建模能力,它学习每个输入标记的时间关系。然而,合成语音的人工痕迹可能位于频率通道和时间段的特定区域,而 MHSA 却忽略了这种时序-通道依赖性。在本工作中,我们提出了时序-通道建模(TCM)模块,以增强 MHSA 捕获时序-通道依赖性的能力。在 ASVspoof 2021 数据集上的实验结果表明,仅凭 0.03M 的额外参数,TCM 模块能够以 9.25% 的 EER 提升超过最先进的系统。进一步的消融研究揭示,使用时序和通道信息可为检测合成语音提供最佳改进。
引用
@article{arxiv.2406.17376,
title = {Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection},
author = {Duc-Tuan Truong and Ruijie Tao and Tuan Nguyen and Hieu-Thi Luong and Kong Aik Lee and Eng Siong Chng},
journal= {arXiv preprint arXiv:2406.17376},
year = {2024}
}
备注
Accepted by INTERSPEECH 2024