中文

面向低资源语言环境的虚假信息检测统一大语言模型

计算与语言 2025-06-03 v1

摘要

社交媒体平台的快速扩张显著增加了伪造内容和虚假信息的传播,使假新闻检测成为一个关键的研究领域。尽管事实核查工作主要集中在英语新闻上,但在检测诸如乌尔都语等地区语言新闻的资源和策略方面存在明显差距。先进的假新闻检测(FND)技术严重依赖大型、准确标注的数据集。然而,由于缺乏广泛的语料库和经过验证的词汇资源,乌尔都语等资源匮乏语言中的FND面临重大挑战。当前的乌尔都语假新闻数据集通常局限于特定领域且不向公众开放。它们也缺乏人工验证,主要依赖未经核实的英译乌尔都语翻译,这损害了它们在实际应用中的可靠性。本研究强调了开发可靠、经专家验证且独立于领域的乌尔都语增强FND数据集的必要性,以改善乌尔都语及其他资源受限语言中的假新闻检测。本文提出了首个用于乌尔都语新闻的大型FND基准数据集,该数据集公开可用于验证和深入分析。我们还使用多个最先进的预训练大语言模型(LLM)评估了该数据集,如XLNet、mBERT、XLM-RoBERTa、RoBERTa、DistilBERT和DeBERTa。此外,我们提出了一个统一的LLM模型,该模型结合不同的嵌入和特征提取技术,性能优于其他模型。这些模型的性能基于准确率、F1分数、精确率、召回率和用于审查新闻样本结果的人工判断进行比较。

关键词

引用

@article{arxiv.2506.01587,
  title  = {Unified Large Language Models for Misinformation Detection in Low-Resource Linguistic Settings},
  author = {Muhammad Islam and Javed Ali Khan and Mohammed Abaker and Ali Daud and Azeem Irshad},
  journal= {arXiv preprint arXiv:2506.01587},
  year   = {2025}
}