中文

MALINT数据集及其对LLM恶意意图检测的抗性提升

计算与语言 2026-03-17 v1 人工智能

摘要

恶意意图创建与扩散的误导信息构成对公共话语的重大威胁。然而,现有英文数据集和研究很少关注误导信息背后的意图性。本工作提出MALINT,首个由 expert fact-checkers 合作人工标注的英文语料库,用以捕捉误导信息及其恶意意图。我们利用该语料库,对12种语言模型进行基准测试,包括小型语言模型(如 BERT)和大型语言模型(如 Llama 3.3),进行二分类和多标签意图分类任务。此外,受心理学和传播研究中的免疫理论启发,我们探讨了将恶意意图知识融入是否能提升误导信息检测。为此,我们提出intent-based inoculation,一种intent-augmented reasoning,用于LLM,集成意图分析以减轻误导信息的说服力。对六个误导信息数据集、五种LLM和七种语言的分析表明,intent-augmented reasoning在零样本误导信息检测中取得改进。为支持intent-aware误导信息检测研究,我们发布了来自每个标注步骤的 MALINT 数据集。

关键词

引用

@article{arxiv.2603.14525,
  title  = {MALicious INTent Dataset and Inoculating LLMs for Enhanced Disinformation Detection},
  author = {Arkadiusz Modzelewski and Witold Sosnowski and Eleni Papadopulos and Elisa Sartori and Tiziano Labruna and Giovanni Da San Martino and Adam Wierzbicki},
  journal= {arXiv preprint arXiv:2603.14525},
  year   = {2026}
}

备注

Paper accepted to EACL 2026 Main Conference