用于极端党派新闻检测的 Bangla BERT:一种半监督与可解释 AI 方法
计算与语言
2025-07-30 v1
摘要
在当前的数字环境中,虚假信息快速传播,塑造了公众认知并导致社会分裂。由于缺乏适用于孟加拉语这一低资源语言的先进自然语言处理方法,识别孟加拉语中的极端党派新闻十分困难。如果没有有效的检测方法,带有偏见的内容可能会不受控制地传播,对理性的公共讨论构成严重风险。为了填补这一空白,我们的研究对 Bangla BERT 进行了微调。这是一种最先进的基于 Transformer 的模型,旨在提高极端党派新闻的分类准确性。我们评估了其相对于传统机器学习模型的性能,并实施了半监督学习以进一步提升预测效果。不仅如此,我们还使用 LIME 对模型的决策过程提供了透明的解释,这有助于建立对其结果的信任。根据我们的试验数据,Bangla BERT 以 95.65% 的显著准确率优于传统方法。本研究的结果证明了 Transformer 模型即使在资源有限的环境中同样具有有效性,为该领域的进一步改进打开了大门。
引用
@article{arxiv.2507.21242,
title = {Bangla BERT for Hyperpartisan News Detection: A Semi-Supervised and Explainable AI Approach},
author = {Mohammad Mehadi Hasan and Fatema Binte Hassan and Md Al Jubair and Zobayer Ahmed and Sazzatul Yeakin and Md Masum Billah},
journal= {arXiv preprint arXiv:2507.21242},
year = {2025}
}