基于多阶段对抗推理的无训练可解释仇恨视频检测
计算机视觉与模式识别
2026-01-22 v1
摘要
仇恨视频通过放大歧视、煽动暴力以及破坏网络安全而带来严重风险。现有的基于训练的仇恨视频检测方法受限于有限的训练数据且缺乏可解释性,而直接提示大型视觉语言模型往往难以实现可靠的仇恨检测。为应对这些挑战,本文提出了 MARS,这是一个无训练的多阶段对抗推理框架,能够实现可靠且可解释的仇恨内容检测。MARS 从对视频内容的客观描述开始,为后续分析建立中立基础。在此基础上,它发展出支持潜在仇恨解释的基于证据的推理,同时并行引入反证据推理以捕捉合理的非仇恨视角。最后,这些视角被综合为一个结论性且可解释的决策。在两个真实世界数据集上的广泛评估表明,在某些骨干网络和设置下,MARS 与其他无训练方法相比实现了高达 10% 的提升,并在一个数据集上优于最先进的基于训练的方法。此外,MARS 生成人类可理解的依据,从而支持合规监督并增强内容审核工作流程的透明度。代码可在 https://github.com/Multimodal-Intelligence-Lab-MIL/MARS 获取。
引用
@article{arxiv.2601.15115,
title = {Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning},
author = {Shuonan Yang and Yuchen Zhang and Zeyu Fu},
journal= {arXiv preprint arXiv:2601.15115},
year = {2026}
}
备注
Accepted at ICASSP 2026. \c{opyright} 2026 IEEE. This is the author accepted manuscript. The final published version will be available via IEEE Xplore