中文

DeToxy:面向口语毒性分类的大规模多模态数据集

计算与语言 2022-04-05 v3 声音 音频与语音处理

摘要

有毒言论,亦称仇恨言论,被视为当今困扰在线社交媒体的关键问题之一。近期大多数关于有毒言论检测的工作局限于文本和书面对话模态,针对口语或利用语音模态进行毒性检测的研究极为有限。本文介绍了一个新数据集 DeToxy,这是首个公开可用的英语毒性标注数据集。DeToxy 来源于多个公开语音数据库,包含超过 200 万条话语。我们相信,该数据集将为从口语中检测毒性这一相对新颖且尚未探索的口语处理任务提供基准,并推动该领域的进一步研究。最后,我们还为数据集提供了强基线单模态方法,并比较了传统的两步法与端到端方法。实验表明,在口语场景下,基于文本的方法在很大程度上依赖人工标注的黄金转录文本以获得性能,并且还受到关键词偏差问题的困扰。然而,DeToxy 中语音文件的存在有助于开发端到端语音模型,这类模型通过更好地捕捉语音线索,缓解了上述两个问题。

关键词

引用

@article{arxiv.2110.07592,
  title  = {DeToxy: A Large-Scale Multimodal Dataset for Toxicity Classification in Spoken Utterances},
  author = {Sreyan Ghosh and Samden Lepcha and S Sakshi and Rajiv Ratn Shah and S. Umesh},
  journal= {arXiv preprint arXiv:2110.07592},
  year   = {2022}
}

备注

Submitted to Interspeech 2022