摆脱表象,连接领域:基于测试时适应的转移多模态仇恨视频检测
计算机视觉与模式识别
2026-02-03 v1
摘要
仇恨视频检测(HVD)对于在线生态系统至关重要。现有方法假设训练(源)数据与推理(目标)数据分布相同。然而,仇恨内容常演变为不规则且模糊的形式以规避审查,导致显著语义漂移,使先前训练的模型失效。测试时适应(TTA)通过在推理期间适应模型来缩小跨域差距,为此提供了解决方案,但常规 TTA 方法针对轻微分布漂移,难以应对 HVD 中的严重语义漂移。为解决这些挑战,我们提出 SCANNER,首个针对 HVD 的 TTA 框架。灵感来自:仇恨表现虽在演变,但其核心仍基本不变(即定向仍基于性别、种族等特征)。我们利用这些稳定核心作为桥梁连接源域与目标域。具体而言,SCANNER 通过原则性的质心引导对齐机制从模糊布局中揭示稳定核心。为缓解在对齐过程中与质心关系弱的异常样本影响,SCANNER 引入样本级自适应质心对齐策略,促进更稳定的适应。此外,为缓解簇内过度均匀输出导致的语义坍塌,SCANNER 引入簇内多样性正则化,鼓励簇级语义丰富性。实验显示,SCANNER 在所有基线上均超越,宏平均 F1 分数提升平均 4.69%。
引用
@article{arxiv.2602.00132,
title = {Shedding the Facades, Connecting the Domains: Detecting Shifting Multimodal Hate Video with Test-Time Adaptation},
author = {Jiao Li and Jian Lang and Xikai Tang and Wenzheng Shu and Ting Zhong and Qiang Gao and Yong Wang and Leiting Chen and Fan Zhou},
journal= {arXiv preprint arXiv:2602.00132},
year = {2026}
}
备注
Accepted by AAAI2026 main track