面向维基百科的公平多语言破坏检测系统
机器学习
2023-06-05 v1
摘要
本文提出一种新颖的系统设计,旨在支持维基百科社区处理平台上的破坏行为。为此,我们收集了涵盖 47 种语言的大规模数据集,并应用先进的过滤与特征工程技术,包括多语言掩码语言建模,以从人类生成数据构建训练集。系统性能通过与维基百科生产环境所用、称为 ORES 的系统比较进行评估。我们的研究结果显著增加了所覆盖语言数量,使维基百科巡查对更广泛社群更为高效。此外,我们的模型优于 ORES,确保所提供结果不仅更准确,且对特定贡献者群体的偏见更小。
引用
@article{arxiv.2306.01650,
title = {Fair multilingual vandalism detection system for Wikipedia},
author = {Mykola Trokhymovych and Muniza Aslam and Ai-Jou Chou and Ricardo Baeza-Yates and Diego Saez-Trumper},
journal= {arXiv preprint arXiv:2306.01650},
year = {2023}
}