语音数据在减少毒性检测偏差中的作用
计算与语言
2025-05-19 v2 人工智能
机器学习
声音
音频与语音处理
摘要
文本毒性检测系统存在显著偏差,对提到人口统计学群体的样本产生不成比例的误判阳性率。但语音中的毒性检测会怎样呢?为调查文本基方法是否被语音方法所缓解,我们为多语言 MuTox 数据集制作了一组高质量的群组标注,然后利用这些标注系统atically 比较语音和文本毒性分类器。我们的发现表明,在推断期间获取语音数据可支持对群组提及的偏差降低,特别是对于模糊且引发争议的样本。我们的结果还表明,改进分类器而非转录管道对减少群组偏差更有帮助。我们公开发布我们的标注并为未来的毒性数据集构建提供建议。
引用
@article{arxiv.2411.08135,
title = {On the Role of Speech Data in Reducing Toxicity Detection Bias},
author = {Samuel J. Bell and Mariano Coria Meglioli and Megan Richards and Eduardo Sánchez and Christophe Ropers and Skyler Wang and Adina Williams and Levent Sagun and Marta R. Costa-jussà},
journal= {arXiv preprint arXiv:2411.08135},
year = {2025}
}
备注
Accepted at NAACL 2025