通过有序回归扩展ORES实现维基百科文章质量的一维度量
计算与语言
2021-09-02 v2 计算机与社会
机器学习
摘要
组织复杂的同行生产项目以及推进开放协作的科学知识,都依赖于度量质量的能力。英语维基百科上的文章质量评级已被维基百科社区成员和学术研究人员广泛使用,用于追踪知识差距和研究政治极化如何影响协作等目的。即便如此,度量质量仍面临许多方法论挑战。最广泛使用的系统在评估质量时使用离散有序尺度上的标签,但此类标签对于统计和机器学习而言可能不够方便。先前的工作通过假设不同质量级别之间“等距”来处理这一问题。这一假设与将维基百科百科文章提升到不同质量级别所需相对努力程度的直觉相悖。此外,先前工作的模型拟合于过度采样高质量文章的数据集。这限制了它们对文章或修订的代表性样本的准确性。我描述了一种扩展维基媒体基金会 ORES 文章质量模型以解决这些局限性的技术。我的方法使用加权有序回归模型来构建一维连续质量度量。虽然我的技术与先前方法得出的分数具有相关性,但我的方法提高了研究数据集的准确性,并提供了证据表明“等距”假设在英语维基百科的实践中是缺乏依据的。最后,我提出了在未来研究中使用质量分数的建议,并提供了完整的代码、数据和模型。
引用
@article{arxiv.2108.10684,
title = {Measuring Wikipedia Article Quality in One Dimension by Extending ORES with Ordinal Regression},
author = {Nathan TeBlunthuis},
journal= {arXiv preprint arXiv:2108.10684},
year = {2021}
}
备注
15 pages, 4 figures, Accepted to OpenSym 2021