MEME-Fusion@CHiPSAL 2026:关于尼泊尔表情包的仇恨检测与情感分析的多模态消失实验
计算与语言
2026-04-17 v1 人工智能
摘要
Devanagari 脚本社交媒体表情包的仇恨语言检测面临多模态内容结构、脚本特定语言复杂性和低资源环境数据稀缺的叠加挑战。本文提出了用于 CHiPSAL 2026 共享任务的系统方案,涵盖子任务A(二分类仇恨语言检测)和子任务B(三分类情感分类:积极、中性、消极)。我们提出了一种混合跨模态注意力融合架构,将CLIP(ViT-B/32)用于视觉编码,结合BGE-M3进行多语言文本表征,通过4头自注意力和可学习门控网络实现模态贡献在每个样本上的动态加权。系统评估了八种模型配置,表明明确的跨模态推理在子任务A上相对于文本唯一基线实现了5.9%的F1-macro提升,同时发现两个意外但关键的发现:英语中心视觉模型在Devanagari脚本上表现接近随机,标准集成方法在数据稀缺(每折几乎等于850)下因相关过拟合而出现灾难性退化。代码可访问于 https://github.com/Tri-Yantra-Technologies/MEME-Fusion/
引用
@article{arxiv.2604.14218,
title = {MEME-Fusion@CHiPSAL 2026: Multimodal Ablation Study of Hate Detection and Sentiment Analysis on Nepali Memes},
author = {Samir Wagle and Reewaj Khanal and Abiral Adhikari},
journal= {arXiv preprint arXiv:2604.14218},
year = {2026}
}
备注
PrePrint