多语言与多模态滥用检测
音频与语音处理
2022-04-06 v1 计算与语言
机器学习
声音
摘要
社交媒体平台上滥用内容的存在是不可取的,因为它严重妨碍健康安全的社交媒体交互。尽管自动滥用检测在文本领域已被广泛探索,音频滥用检测仍属空白。本文中,我们在多语言社交媒体环境下从多模态视角尝试对话音频中的滥用检测。我们的核心假设是,除音频建模外,融入其他模态的判别性信息对此任务极有益处。我们提出的方法 MADA 明确关注音频之外的两种模态,即滥用音频中表达的内在情感与对应文本形式所封装的语义信息。观察表明,在 ADIMA 数据集上 MADA 较仅音频方法取得提升。我们在 10 种不同语言上测试所提方法,并观察到利用多模态带来 0.6%–5.2% 的一致提升。我们还进行了大量消融实验以研究各模态贡献,并观察到联合利用所有模态时结果最佳。此外,我们经实验实证确认内在情感与滥用行为间存在强相关性。
引用
@article{arxiv.2204.02263,
title = {Multilingual and Multimodal Abuse Detection},
author = {Rini Sharon and Heet Shah and Debdoot Mukherjee and Vikram Gupta},
journal= {arXiv preprint arXiv:2204.02263},
year = {2022}
}
备注
Submitted to Interspeech 2022