基于 Transformer 的多语言虚假信息检测
计算与语言
2026-05-12 v1 机器学习
摘要
虚假信息在语言边界之间迅速传播,但大多数 AI 模型仅在英语上进行基准测试。我们通过对比比较五种多语言 Transformer 模型:mBERT、XLM、XLM-RoBERTa、RemBERT 和 mT5 在常见的假与真机器学习分类任务中的表现,来弥合这一差距。尽管 Transformer 基于的语言模型在检测英语中的虚假信息方面已显示出显著的成功,但其在多语言情境中的有效性仍值得争议。为便于评估,我们引入了 PolyTruth Disinfo 语料库,这是一个包含 60,486 对语句对(虚假主张与事实性矫正)的新型语料库,覆盖超过二十五种语言,整体覆盖五个语言家族,并涵盖从政治、健康、气候、金融到阴谋论等广泛的主题范围,其中一半来自增强版 MindBugs Discovery 数据集验证的事实核查虚假信息主张。我们的实验结果揭示了性能差异。诸如 RemBERT 等模型在整体准确率方面取得更好表现,尤其在低资源语言中表现突出;而 mBERT 和 XLM 在训练数据稀缺时表现出显著的局限性。我们提供了这些性能模式及其对实际部署的讨论。该数据集已公开于我们的 GitHub 仓库,以鼓励进一步的实验和发展。我们的发现阐明了 AI 系统在多语言虚假信息检测方面的潜力及当前局限性。
引用
@article{arxiv.2509.10737,
title = {PolyTruth: Multilingual Disinformation Detection using Transformer-Based Language Models},
author = {Zaur Gouliev and Jennifer Waters and Chengqian Wang},
journal= {arXiv preprint arXiv:2509.10737},
year = {2026}
}
备注
11 pages, 5 figures, 4 tables. Submitted to arXiv in Computation and Language