ADIMA:多语言音频中的辱骂检测
声音
2022-02-17 v1 计算与语言
音频与语音处理
摘要
口语文本中的辱骂内容检测可通过自动语音识别(ASR)并利用自然语言处理进展来解决。然而,ASR模型会引入延迟,且对脏话词常表现欠佳,因其在训练语料中代表性不足且未被清晰或完整说出。完全在音频领域对该问题的探索很大程度上受限于音频数据集的缺乏。基于这些挑战,我们提出ADIMA,一个新颖、语言多样、伦理来源、专家标注且均衡的多语言脏话检测音频数据集,包含10种印度语言共11,775个音频样本,时长65小时,由6,446名独立用户录制。通过在单语和跨语零样本设置下的定量实验,我们迈出了印度语言基于音频的内容审核民主化的第一步,并发布我们的数据集以铺就未来工作。
引用
@article{arxiv.2202.07991,
title = {ADIMA: Abuse Detection In Multilingual Audio},
author = {Vikram Gupta and Rini Sharon and Ramit Sawhney and Debdoot Mukherjee},
journal= {arXiv preprint arXiv:2202.07991},
year = {2022}
}