SceneFake:用于场景伪造音频检测的初步数据集与基准
声音
2024-04-05 v2 计算与语言
音频与语音处理
摘要
许多数据集已被设计以推动伪造音频检测的发展。然而,以往数据集中的伪造语音大多通过改变原始音频的音色、韵律、语言内容或信道噪声来生成。这些数据集遗漏了一种场景,即原始音频的声学场景被伪造场景所篡改。若有人出于恶意目的滥用此类篡改音频,将对社会构成重大威胁。因此,这促使我们填补该空白。本文提出一个名为 SceneFake 的用于场景伪造音频检测的数据集,其中篡改音频仅通过使用语音增强技术篡改真实语音的声学场景而生成。本文报告了在 SceneFake 数据集上的一些场景伪造音频检测基准结果。此外,本文给出了针对不同语音增强技术与信噪比下伪造攻击的分析。结果表明,在 ASVspoof 2019 数据集上训练的基线模型无法可靠检测场景伪造语音。尽管这些模型在 SceneFake 训练集与已见测试集上表现良好,其在未见测试集上的性能较差。该数据集(https://zenodo.org/record/7663324#.Y_XKMuPYuUk)与基准源代码(https://github.com/ADDchallenge/SceneFake)已公开可用。
引用
@article{arxiv.2211.06073,
title = {SceneFake: An Initial Dataset and Benchmarks for Scene Fake Audio Detection},
author = {Jiangyan Yi and Chenglong Wang and Jianhua Tao and Chu Yuan Zhang and Cunhang Fan and Zhengkun Tian and Haoxin Ma and Ruibo Fu},
journal= {arXiv preprint arXiv:2211.06073},
year = {2024}
}
备注
Accepted by Pattern Recognition, 1 April 2024