中文

LLM是否足够用于识别仇恨、虚假、极化和有害内容?评估原地学习与微调

计算与语言 2025-09-10 v1 人工智能

摘要

虚假新闻、极化内容、政治偏见及有害内容在线平台上的传播已成为严重关切。尽管大语言模型成为有前景的解决方案,但尚无研究对其在不同模型、使用方法和语言间的性能进行规范基准测试。本研究提供了不同大语言模型适应范式的全面概览,用于检测仇恨极端主义内容、虚假新闻、有害推文及政治偏见。我们的实验覆盖10个数据集和5种语言(英语、西班牙语、葡萄牙语、阿拉伯语和保加利亚语),涵盖二分类和多分类场景。我们测试了从参数高效微调语言模型到各种原地学习策略的不同方法,包括零样本提示、codebook、few-shot(分别使用随机选择和基于 determinants 点过程的多样化选择示例),以及链式思考。我们发现原地学习往往不如微调。此主要发现凸显了即使在原地学习设置下,对较小模型进行任务特定微调的重要性——即使是我们评估的LlaMA3.1-8b-Instruct、Mistral-Nemo-Instruct-2407和Qwen2.5-7B-Instruct等最大模型。

关键词

引用

@article{arxiv.2509.07768,
  title  = {Are LLMs Enough for Hyperpartisan, Fake, Polarized and Harmful Content Detection? Evaluating In-Context Learning vs. Fine-Tuning},
  author = {Michele Joshua Maggini and Dhia Merzougui and Rabiraj Bandyopadhyay and Gaël Dias and Fabrice Maurel and Pablo Gamallo},
  journal= {arXiv preprint arXiv:2509.07768},
  year   = {2025}
}