从稀缺到能力:利用 LLM 赋能低资源语言的虚假新闻检测
计算与语言
2025-02-18 v1
摘要
虚假新闻的快速传播构成了重大的全球挑战,在孟加拉语等缺乏充足数据集和检测工具的低资源语言中尤为如此。尽管人工事实核查准确,但其成本高昂且速度慢,难以阻止虚假新闻的传播。为了填补这一空白,我们引入了 BanFakeNews-2.0,一个用于增强孟加拉语虚假新闻检测的稳健数据集。该版本包含 11,700 篇经过精心整理并经可靠来源验证的额外虚假新闻文章,构建了一个包含 13 个类别中 47,000 条真实新闻和 13,000 条虚假新闻的比例数据集。此外,我们还创建了一个包含 460 条虚假新闻和 540 条真实新闻的手动整理的独立测试集,用于严格的评估。我们致力于从可靠来源收集虚假新闻并进行人工验证,同时保留其语言丰富性。我们开发了一个利用基于 Transformer 架构的基准系统,包括微调的 Transformers 双向编码器表示变体 (F1-87%) 和带有量化低秩近似的大语言模型 (F1-89%),显著优于传统方法。BanFakeNews-2.0 为推进低资源语言虚假新闻检测的研究和应用提供了宝贵的资源。我们在 Github 上公开发布了我们的数据集和模型,以促进这一方向的研究。
引用
@article{arxiv.2501.09604,
title = {From Scarcity to Capability: Empowering Fake News Detection in Low-Resource Languages with LLMs},
author = {Hrithik Majumdar Shibu and Shrestha Datta and Md. Sumon Miah and Nasrullah Sami and Mahruba Sharmin Chowdhury and Md. Saiful Islam},
journal= {arXiv preprint arXiv:2501.09604},
year = {2025}
}