面向低资源语言深度伪造仇恨言论检测的多模态零样本框架
声音
2025-06-11 v1 音频与语音处理
摘要
本文提出了一种新颖的多模态框架,用于检测深度伪造音频中的仇恨言论,该框架甚至在零样本场景中也表现出色。与以往方法不同,我们的方法使用对比学习来联合对齐跨语言的音频和文本表示。我们提出了首个基准数据集,包含六种语言的 127,290 对文本与合成语音样本:英语和五种低资源印度语言(印地语、孟加拉语、马拉地语、泰米尔语、泰卢固语)。我们的模型学习了一个共享语义嵌入空间,从而实现了稳健的跨语言和跨模态分类。在两个多语言测试集上的实验表明,我们的方法优于基线,分别达到了 0.819 和 0.701 的准确率,并且能很好地泛化到未见过的语言。这证明了在合成媒体中结合多种模态进行仇恨言论检测的优势,尤其是在单模态模型失效的低资源场景下。数据集可在 https://www.iab-rubric.org/resources 获取。
引用
@article{arxiv.2506.08372,
title = {Multimodal Zero-Shot Framework for Deepfake Hate Speech Detection in Low-Resource Languages},
author = {Rishabh Ranjan and Likhith Ayinala and Mayank Vatsa and Richa Singh},
journal= {arXiv preprint arXiv:2506.08372},
year = {2025}
}
备注
Accepted in Interpseech 2025