情感能否欺骗防欺骗模型?
音频与语音处理
2025-06-02 v1 机器学习
声音
摘要
传统的防欺骗研究侧重于基于大多为中性状态的合成语音构建的模型和数据集,忽略了多样的情感变化。因此,它们对高质量、富有情感的合成语音的鲁棒性尚不确定。我们通过引入 EmoSpoof-TTS(一个情感文本转语音样本语料库)来解决这个问题。我们的分析表明,现有的防欺骗模型在处理情感合成语音时存在困难,暴露了针对情感攻击的风险。即使在情感数据上进行训练,由于对情感方面的关注有限,这些模型的表现依然不佳,并且在不同情感间表现出性能差异。这凸显了在数据集和方法论上建立以情感为中心的防欺骗范式的必要性。我们提出了 GEM,一个由语音情感识别门控网络控制的、面向情感专用模型的门控集成模型。GEM 在所有情感和中性状态下均表现有效,增强了对欺骗攻击的防御。我们发布了 EmoSpoof-TTS 数据集:https://emospoof-tts.github.io/Dataset/
引用
@article{arxiv.2505.23962,
title = {Can Emotion Fool Anti-spoofing?},
author = {Aurosweta Mahapatra and Ismail Rasim Ulgen and Abinay Reddy Naini and Carlos Busso and Berrak Sisman},
journal= {arXiv preprint arXiv:2505.23962},
year = {2025}
}
备注
Accepted to Interspeech 2025