中文

通过大语言模型间的多模态辩论实现可解释的有害模因检测

计算与语言 2024-01-25 v1 人工智能

摘要

社交媒体时代充斥着互联网模因,这 necessitates 对有害模因的清晰理解与有效识别。由于模因中蕴含的隐含意义并未通过表层文本和图像显式传达,该任务提出了重大挑战。然而,现有的有害模因检测方法并未提供可读的解释来揭示此类隐含意义以支持其检测决策。在本文中,我们提出了一种可解释的有害模因检测方法,该方法通过对来自无害和有害立场的冲突理由进行推理来实现。具体而言,受大语言模型(LLM)在文本生成与推理方面强大能力的启发,我们首先在 LLM 之间引发多模态辩论,以生成源自矛盾论点的解释。然后,我们提出微调一个小型语言模型作为有害性推断的辩论裁判,以促进有害性理由与模因内在多模态信息之间的多模态融合。通过这种方式,我们的模型能够利用源自无害和有害论点的多模态解释,对复杂且隐含的有害指示模式进行辩证推理。在三个公开模因数据集上的大量实验表明,我们的有害模因检测方法取得了远优于 SOTA 方法的性能,并展现出卓越的模型预测模因有害性的解释能力。

关键词

引用

@article{arxiv.2401.13298,
  title  = {Towards Explainable Harmful Meme Detection through Multimodal Debate between Large Language Models},
  author = {Hongzhan Lin and Ziyang Luo and Wei Gao and Jing Ma and Bo Wang and Ruichao Yang},
  journal= {arXiv preprint arXiv:2401.13298},
  year   = {2024}
}

备注

The first work towards explainable harmful meme detection by harnessing advanced LLMs