2018-2024 年全球新闻文章按感知质量的分类
计算与语言
2025-11-21 v1 机器学习
摘要
本研究探讨了监督式机器学习和深度学习模型是否能够有效区分感知质量较低的新闻文章与感知质量较高的新闻文章。对 3 种机器学习分类器和 3 种深度学习模型进行评估,采用新建的 141272 篇 2018-2024 年从 Common Crawl 收集的英语新闻文章数据集。对 579 个新闻来源网站的专家共识评分按中位数划分,创建约为 706000 篇每类的感知低质量与高质量类别,每篇网站级别标注文章包含 194 个语言特征。传统机器学习分类器如随机森林 demonstrated 出色的性能(准确率为 0.7355,ROC-AUC 为 0.8131)。对于深度学习模型,ModernBERT-large(256 上下文长度)取得最佳性能(准确率 0.8744;ROC-AUC 0.9593;F1 0.8739),其后是 DistilBERT-base(512 上下文长度)在准确率 0.8685 和 ROC-AUC 0.9554 方面,DistilBERT-base(256 上下文长度)达到 0.8478 的准确率和 0.9407 的 ROC-AUC,而 ModernBERT-base(256 上下文长度)实现了 0.8569 的准确率和 0.9470 的 ROC-AUC。这些结果表明,感知质量较低的全球新闻文章可以被有效地由基于 CPU 的传统机器学习分类器和深度学习分类器区分。
引用
@article{arxiv.2511.16416,
title = {Classification of worldwide news articles by perceived quality, 2018-2024},
author = {Connor McElroy and Thiago E. A. de Oliveira and Chris Brogly},
journal= {arXiv preprint arXiv:2511.16416},
year = {2025}
}