cantnlp@DravidianLangTech2025:一种基于 Bag-of-Sounds 的多模态仇恨言论检测方法
计算与语言
2025-03-18 v2
摘要
本文展示了在第五届达罗毗荼语言语音、视觉与语言技术研讨会(DravidianLangTech-2025)上的多模态社交媒体数据分析(MSMDA-DL)共享任务中的系统与结果。我们采用'声音袋'(Bag-of-Sounds)方法,通过训练转换后的 Mel 频谱图度量,在语音(音频)数据上训练仇恨言论检测系统。虽然我们的候选模型在测试集上表现不佳,但该方法在训练和开发阶段为马拉雅拉姆语和泰米尔语提供了有前景的结果。随着充足且均衡的训练数据,我们的结果表明,在多模态仇恨言论检测系统的开发中同时使用文本和语音(音频)数据是可行的。
引用
@article{arxiv.2503.07862,
title = {cantnlp@DravidianLangTech2025: A Bag-of-Sounds Approach to Multimodal Hate Speech Detection},
author = {Sidney Wong and Andrew Li},
journal= {arXiv preprint arXiv:2503.07862},
year = {2025}
}
备注
Accepted Fifth Workshop on Speech and Language Technologies for Dravidian Languages