中文

基于 LLM 的数据增强在 COVID-19 错误信息立场检测中的有限有效性

计算与语言 2025-03-05 v1 计算机与社会 人机交互 社会与信息网络

摘要

围绕新发疫情的错误信息构成了严重的社会威胁,使得稳健的应对措施至关重要。一种有前景的方法是立场检测(SD),它识别社交媒体帖子是支持还是反对误导性声明。在本工作中,我们在由声明和相应推文组成的 COVID-19 错误信息立场检测数据集上微调分类器。具体而言,我们测试了使用大型语言模型(LLMs)进行可控错误信息生成(CMG)作为数据增强的方法。尽管 CMG 展现了扩展训练数据集的潜力,但我们的实验表明,与传统增强方法相比,其性能提升通常微乎其微且不稳定,这主要是由于 LLMs 内置的安全防护机制。我们发布了代码和数据集,以促进对错误信息检测和生成的进一步研究。

关键词

引用

@article{arxiv.2503.02328,
  title  = {Limited Effectiveness of LLM-based Data Augmentation for COVID-19 Misinformation Stance Detection},
  author = {Eun Cheol Choi and Ashwin Balasubramanian and Jinhu Qi and Emilio Ferrara},
  journal= {arXiv preprint arXiv:2503.02328},
  year   = {2025}
}