在辩论中区分对错:中文有害模因的归因分析
计算与语言
2026-05-26 v1
摘要
有害模因检测的研究已引起广泛关注,并产生了大量数据集和方法。然而,中文有害模因检测的进展明显滞后,主要由于两个挑战:首先,准确评估模因的有害性在很大程度上依赖于对深层文化背景的理解;其次,许多模因在语义上是模糊的,使得有害性具有高度主观性。为了解决这些问题,我们专注于中文有害模因的可解释检测,构建了首个中文有害模因解释数据集Ex-ToxiCN-MM。该数据集为每个模因提供了对立解释,分为“有害”和“无害”两类,旨在严格评估模型辨别和理解模糊的、植根于文化的内容的能力。我们构建了一个专门的中文文化概念和冒犯性词汇知识库(C-HarmKB),为模型提供必要的先验知识。为了解决模因归因中的模糊性和背景知识缺失问题,我们开发了一个全面的归因分析框架RIKE,其中包括归因知识增强模块(AKE)和相对意图推理模块(RIR)。大量的定量和定性实验表明,我们的方法在中文有害模因归因任务中,在多个指标上优于主流基线模型。本研究中涉及的代码、Ex-ToxiCN-MM数据集和中文有害语义知识库(C-HarmKB)已在https://github.com/wimiw123/Ex-ToxiCN-MM开源。
引用
@article{arxiv.2605.24344,
title = {Distinguishing Right from Wrong in Debates: Attribution Analysis of Chinese Harmful Memes},
author = {Weiming Wang and Junyu Lu and Han Wang and Xiaokun Zhang and Zewen Bai and Bo Xu and Liang Yang and Hongfei Lin},
journal= {arXiv preprint arXiv:2605.24344},
year = {2026}
}
备注
10 pages, 4 figures