中文

EmoFake: 面向情感伪造音频检测的初始数据集

声音 2024-07-25 v4 音频与语音处理

摘要

为了推动伪造音频检测的发展,人们已经设计了许多数据集,例如 ASVspoof 和 ADD 挑战赛的数据集。然而,这些数据集并未考虑音频情感从一种改变为另一种,而其他信息(例如说话人身份和内容)保持不变的情况。改变音频的情感可能会导致语义变化。语义被篡改的语音可能会对人们的生活造成威胁。因此,本文报告了我们在开发此类情感伪造音频检测数据集方面的进展,该数据集涉及改变原始音频的情感状态,名为 EmoFake。EmoFake 中的伪造音频由开源的情感语音转换模型生成。此外,我们提出了一种名为使用深度情感嵌入的图注意力网络(GADE)的方法,用于检测情感伪造音频。在该数据集上进行了一些基准实验。结果表明,我们设计的数据集对使用 ASVspoof 2019 的 LA 数据集训练的伪造音频检测模型构成了挑战。所提出的 GADE 在面对情感伪造音频时表现出良好的性能。

关键词

引用

@article{arxiv.2211.05363,
  title  = {EmoFake: An Initial Dataset for Emotion Fake Audio Detection},
  author = {Yan Zhao and Jiangyan Yi and Jianhua Tao and Chenglong Wang and Xiaohui Zhang and Yongfeng Dong},
  journal= {arXiv preprint arXiv:2211.05363},
  year   = {2024}
}