基于 LLM 的数据增强在 COVID-19 错误信息立场检测中的有限有效性
计算与语言
2025-03-05 v1 计算机与社会
人机交互
社会与信息网络
摘要
围绕新发疫情的错误信息构成了严重的社会威胁,使得稳健的应对措施至关重要。一种有前景的方法是立场检测(SD),它识别社交媒体帖子是支持还是反对误导性声明。在本工作中,我们在由声明和相应推文组成的 COVID-19 错误信息立场检测数据集上微调分类器。具体而言,我们测试了使用大型语言模型(LLMs)进行可控错误信息生成(CMG)作为数据增强的方法。尽管 CMG 展现了扩展训练数据集的潜力,但我们的实验表明,与传统增强方法相比,其性能提升通常微乎其微且不稳定,这主要是由于 LLMs 内置的安全防护机制。我们发布了代码和数据集,以促进对错误信息检测和生成的进一步研究。
引用
@article{arxiv.2503.02328,
title = {Limited Effectiveness of LLM-based Data Augmentation for COVID-19 Misinformation Stance Detection},
author = {Eun Cheol Choi and Ashwin Balasubramanian and Jinhu Qi and Emilio Ferrara},
journal= {arXiv preprint arXiv:2503.02328},
year = {2025}
}