HateMirage:用于解码伪仇恨与隐性网络滥用的数据集
计算与语言
2026-03-04 v1 社会与信息网络
摘要
微妙且间接的仇恨言论在在线安全研究中仍是一个未被充分探讨的挑战,尤其当有害意图被嵌入误导性或操纵性叙事之中时。现有的仇恨言论数据集主要捕获公开的毒性,未能代表误information如何诱发或正常化仇恨的细腻方式。为填补这一空白,我们提出了HateMirage——一个包含伪仇恨评论的新型数据集,以推动基于虚假或扭曲叙事中仇恨产生的推理与可解释性研究。该数据集通过从事实核查来源中识别广为揭霉的误information论点,并追踪相关YouTube讨论,最终得到4,530条用户评论。每条评论在三个可解释维度上进行标注:目标(受影响者)、意图(潜在动机或目标)以及含义(其潜在社会影响)。与HateXplain和HARE等先前的可解释性数据集不同,HateMirage引入了多维解释框架,捕捉误information、伤害与社会后果之间的相互作用。我们使用ROUGE-L F1和Sentence-BERT相似度对HateMirage上的多个开源语言模型进行基准测试,以评估解释的连贯性。结果表明,解释质量可能更多地取决于预训练的多样性和推理导向的数据,而非模型规模。通过将误information推理与伤害归因相结合,HateMirage为可解释仇恨检测和负责任AI研究建立了新的基准。
关键词
引用
@article{arxiv.2603.02684,
title = {HateMirage: An Explainable Multi-Dimensional Dataset for Decoding Faux Hate and Subtle Online Abuse},
author = {Sai Kartheek Reddy Kasu and Shankar Biradar and Sunil Saumya and Md. Shad Akhtar},
journal= {arXiv preprint arXiv:2603.02684},
year = {2026}
}
备注
Accepted at LREC 2026