MuTox:通用多语言音频毒性数据集与零样本检测器
声音
2024-06-28 v2 计算与语言
音频与语音处理
摘要
针对语音模态(基于音频)的自然语言处理中毒性检测研究相当有限,尤其是英语以外的语言。为解决这些局限并为真正的多语言音频毒性检测奠定基础,我们引入了 MuTox,这是首个带有毒性标签的高度多语言音频数据集。该数据集包含英语和西班牙语的 20,000 条音频话语,以及其他 19 种语言的各 4,000 条话语。为证明该数据集的质量,我们训练了 MuTox 音频毒性分类器,该分类器能够在广泛的语言范围内进行零样本毒性检测。该分类器的 AUC 比现有的基于文本的可训练分类器高出 1% 以上,同时将语言覆盖范围扩大了十倍以上。与覆盖相似语言数量的基于词表的分类器相比,MuTox 将精确率和召回率提高了约 2.5 倍。这一显著改进凸显了 MuTox 在推动音频毒性检测领域发展方面的潜力。
引用
@article{arxiv.2401.05060,
title = {MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector},
author = {Marta R. Costa-jussà and Mariano Coria Meglioli and Pierre Andrews and David Dale and Prangthip Hansanti and Elahe Kalbassi and Alex Mourachko and Christophe Ropers and Carleigh Wood},
journal= {arXiv preprint arXiv:2401.05060},
year = {2024}
}