中文

乌尔都语假新闻分类:一种面向低资源语言的领域自适应方法

计算与语言 2025-12-30 v1

摘要

社交媒体上的错误信息是一个被广泛认可的问题,世界各地的研究人员正积极致力于其检测。然而,诸如乌尔都语等低资源语言在该领域受到的关注有限。一种直观的方法是利用多语言预训练语言模型,并将其微调用于下游分类任务,例如错误信息检测。但是,这些模型在处理领域特定术语时存在困难,导致性能次优。为了解决这个问题,我们研究了在针对乌尔都语假新闻分类进行微调之前进行领域自适应的有效性,采用分阶段训练方法以优化模型泛化能力。我们评估了两种广泛使用的多语言模型 XLM-RoBERTa 和 mBERT,并使用公开可用的乌尔都语新闻语料库进行领域自适应预训练。在四个公开可用的乌尔都语假新闻数据集上的实验表明,领域自适应后的 XLM-R 始终优于其原始版本,而领域自适应后的 mBERT 表现不一。

关键词

引用

@article{arxiv.2512.22778,
  title  = {Fake News Classification in Urdu: A Domain Adaptation Approach for a Low-Resource Language},
  author = {Muhammad Zain Ali and Bernhard Pfahringer and Tony Smith},
  journal= {arXiv preprint arXiv:2512.22778},
  year   = {2025}
}