中文

读如观见:引导单模 LLM 实现低资源可解释有害表情包检测

计算与语言 2026-01-29 v2

摘要

检测有害表情包对于维护在线环境的完整性与和谐性至关重要,但现有检测方法往往资源密集、缺乏灵活性和可解释性,限制了其在实际网页内容审核中的应用潜力。我们提出了 U-CoT+ 框架,一个资源高效、注重可及性、灵活性和透明度的框架,完全发挥轻量级单模大语言模型(LLM)能力的作用。不直接使用或微调大型多模态模型(LMM)作为黑盒分类器,而是通过高保真的表情包转文本管道,将表情包内容识别与表情包有害性分析解耦,这一管道与轻量级 LLM 协作,将多模态表情包转换为保留关键视觉信息的自然语言描述,使文本-only LLM 能够通过“阅读”来“看到”表情包。在文本输入为基础,我们进一步通过零样图链式思考(CoT)提示,结合有针对性、可解释、情境感知且易获得的人类精心制作的准则,引导单模 LLM 的推理,提供可解释的逐步论证,同时实现对多样化社会文化有害性标准的灵活且高效的适应。在七个基准数据集上的大量实验表明,U-CoT+ 的性能不输资源密集型基线,凸显其作为支持有害表情包检测的可扩展、可解释、低资源解决方案的有效性与潜力。

关键词

引用

@article{arxiv.2506.08477,
  title  = {Read as You See: Guiding Unimodal LLMs for Low-Resource Explainable Harmful Meme Detection},
  author = {Fengjun Pan and Xiaobao Wu and Tho Quan and Anh Tuan Luu},
  journal= {arXiv preprint arXiv:2506.08477},
  year   = {2026}
}

备注

Accepted to ACM Web Conference 2026 (WWW '26)