假新闻检测:基于生成式AI标注数据的类BERT模型与大语言模型的比较评估
计算与语言
2024-12-23 v2 人工智能
摘要
假新闻对现代社会的公众舆论和社会稳定构成了重大威胁。本研究对类BERT的编码器-only模型和自回归解码器-only大语言模型(LLMs)在假新闻检测方面进行了比较评估。我们引入了一个新闻文章数据集,该数据集借助GPT-4进行标注(一种AI标注方法),并由人类专家验证以确保可靠性。我们在此数据集上微调了类BERT的编码器-only模型和LLMs。此外,我们开发了一种指令微调的LLM方法,在推理时采用多数投票进行标签生成。我们的分析表明,类BERT模型在分类任务中通常优于LLMs,而LLMs对文本扰动表现出更强的鲁棒性。与弱标签(远程监督)数据相比,结果表明带有人类监督的AI标签取得了更好的分类结果。本研究强调了将AI标注与人类监督相结合的有效性,并展示了不同机器学习模型家族在假新闻检测中的性能。
引用
@article{arxiv.2412.14276,
title = {Fake News Detection: Comparative Evaluation of BERT-like Models and Large Language Models with Generative AI-Annotated Data},
author = {Shaina Raza and Drai Paulen-Patterson and Chen Ding},
journal= {arXiv preprint arXiv:2412.14276},
year = {2024}
}
备注
Accepted in Knowledge and Information Systems Journal