从表情包到视频的跨模态迁移:解决仇恨视频检测的数据稀缺问题
计算机视觉与模式识别
2025-01-28 v1 多媒体
摘要
检测在线内容中的仇恨言论对于确保更安全的数字空间至关重要。虽然在文本和表情包模态方面已取得显著进展,但视频基仇恨言论检测仍鲜有探索,受限于缺乏标注数据集以及视频标注成本高昂。这一差距尤其 problematic,因为大型模型对训练数据的需求量巨大。为此,我们利用表情包数据集作为训练仇恨视频检测模型的替代方案和数据增强策略。我们的方法引入了人工辅助的重新标注管道,以最小标注 effort 确保表情包数据集标签与视频数据集标签一致。使用两个最新的视觉语言模型,我们展示了在资源稀缺的场景下,表情包数据可以替代视频数据,并用于数据增强以获得进一步的性能提升。我们的结果持续超过最新的基准,展示了跨模态迁移学习在推动仇恨视频检测方面的潜力。数据集和代码均可在 https://github.com/Social-AI-Studio/CrossModalTransferLearning 提供。
引用
@article{arxiv.2501.15438,
title = {Cross-Modal Transfer from Memes to Videos: Addressing Data Scarcity in Hateful Video Detection},
author = {Han Wang and Rui Yang Tan and Roy Ka-Wei Lee},
journal= {arXiv preprint arXiv:2501.15438},
year = {2025}
}
备注
10 pages, 4 figures, THE WEB CONFERENCE 2025