ToxVidLM:面向代码混合视频的毒性检测多模态框架
人工智能
2024-07-16 v2 计算与语言
计算机视觉与模式识别
摘要
在互联网技术快速发展的时代,包括视频在内的多模态内容的增长,拓展了线上交流的版图。然而,在这一多样化的landscape中检测有毒内容,尤其是在低资源代码混合语言中,仍是一个关键挑战。虽然已有大量研究针对文本数据中的有毒内容进行检测,但视频内容,特别是非英语语言中的视频内容,相对较少被探讨。本文通过引入一个基准数据集来弥补这一研究空白,该数据集由4021个代码混合Hindi-English语音utterance组成,包含931个视频。数据集中每个utterance都经过仔细标注,用于toxicity、severity和sentiment标签。我们开发了一个先进的多任务框架,用于视频内容中的毒性检测,利用面向主要目标的语言模型(LMs),同时辅以情感和严重程度分析任务。ToxVidLM包含三个关键模块——编码器模块、跨模态同步模块和多任务模块——为复杂的视频分类任务量身定制了一个通用的多模态语言模型。我们的实验结果表明,整合视频的多个模态显著提升了有毒内容检测性能,准确率和加权F1分数分别达到94.29%和94.35%。
引用
@article{arxiv.2405.20628,
title = {ToxVidLM: A Multimodal Framework for Toxicity Detection in Code-Mixed Videos},
author = {Krishanu Maity and A. S. Poornash and Sriparna Saha and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2405.20628},
year = {2024}
}
备注
Accepted as a Long Paper in ACL Findings 2024. For acceptance details, see https://2024.aclweb.org/program/finding_papers/