基于大语言模型的数据稀缺性在孟加拉假新闻检测中的增强方法
计算与语言
2026-05-05 v1
摘要
数字媒体中虚假信息的传播不断扩大,凸显可靠假新闻检测系统的需求,但针对此类语言资源匮乏的地区(如孟加拉语)的进展受限于数据集小且不平衡。本研究探讨了大语言模型(LLM)驱动的增强是否能有效缓解此限制并提升孟加拉假新闻分类性能。现有数据集虽具价值,但高度不平衡,限制了模型性能,针对孟加拉语的LLM增强研究尚属稀少。为填补这一空白,本文提出一种系统化的增强框架,通过指令调优的Gemma 3 27B IT模型生成合成孟加拉新闻文章,辅以语义过滤和受控抽样以保持标签一致性和多样性。我们比较零样本和少样本提示,评估多个增强比例,检查随机与基于相似性的选择策略。实验结果表明,仅对少数类进行高增强率和随机抽样的增强效果最佳,使假新闻F1分数从0.85提升至0.88。为支持可重复性和进一步研究,本文公开发布4,545个合成孟加拉假新闻样本及完整实现。这些发现表明,经过精心设计的LLM驱动增强可显著提升低资源环境下的假新闻检测,并为多语言虚假信息研究提供了实用基础。
引用
@article{arxiv.2605.01292,
title = {Addressing Data Scarcity in Bangla Fake News Detection: An LLM-Based Dataset Augmentation Approach},
author = {Ahmed Alfey Sani and Kazi Akib Zaoad and Shefayat E Shams Adib and Md Abdul Muqtadir and Ajwad Abrar},
journal= {arXiv preprint arXiv:2605.01292},
year = {2026}
}
备注
Accepted in 15th ACM ICSCA, 2026 in Langkawi, Malaysia