BanglaFake:构建与评估专用的孟加拉深伪造音频数据集
声音
2025-05-19 v1 人工智能
音频与语音处理
摘要
深伪造音频检测在资源较少的孟加拉语等低资源语言上面临数据有限和声学特征微妙的挑战。为此,我们引入BanglaFake——一个包含12,260段真实音频和13,260段深伪造音频的孟加拉语深伪造音频数据集。合成语音采用领先的文本语音(TTS)模型生成,确保高自然度和质量。我们通过定性和定量分析对该数据集进行评估。30名母语者的平均意见得分(MOS)显示,自然度为3.40,清晰度为4.01。梅尔频率倒谱系数(MFCC)的t-SNE可视化凸显了真实与伪造的区分难度。这一数据集是孟加拉语深伪造检测研究的关键资源,旨在解决低资源语言研究的局限性。
引用
@article{arxiv.2505.10885,
title = {BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset},
author = {Istiaq Ahmed Fahad and Kamruzzaman Asif and Sifat Sikder},
journal= {arXiv preprint arXiv:2505.10885},
year = {2025}
}
备注
5 page