DARC-CLIP:基于跨注意力的动态自适应细化用于梗图理解
计算与语言
2026-04-29 v2
摘要
梗图通过视觉与文本信号的相互作用来传递意义,常常以隐晦的方式结合幽默、讽刺和冒犯。检测梗图中的有害或敏感内容需要准确地建模这些多模态线索。现有的 CLIP 方法基于静态融合,难以捕捉模态之间细粒度的依赖关系。我们提出了 DARC-CLIP,一个基于 CLIP 的自适应多模态融合框架,包含层次化细化堆栈。DARC-CLIP 引入自适应跨注意力细化器(Adaptive Cross-Attention Refiners)用于双向信息对齐,以及动态特征适配器(Dynamic Feature Adapters)用于任务敏感的信号适应。我们在 PrideMM 数据集上评估 DARC-CLIP,该数据集包括仇恨、目标、立场和幽默分类,并进一步在 CrisisHateMM 数据集上测试其泛化能力。DARC-CLIP 在各项任务中实现了高度具竞争力的分类准确率,仇恨检测方面相较于最强基线提升了 +4.18 的 AUROC 和 +6.84 的 F1 分数。消融实验确认,ACAR 和 DFA 是这些提升的主要贡献者。这些结果表明,自适应跨信号细化是社交敏感分类中多模态内容分析的有效策略。
引用
@article{arxiv.2604.23214,
title = {DARC-CLIP: Dynamic Adaptive Refinement with Cross-Attention for Meme Understanding},
author = {Qiyuan Jin},
journal= {arXiv preprint arXiv:2604.23214},
year = {2026}
}
备注
Accepted to IEEE ICASSP 2026. 5 pages, 3 figures, 4 tables