面向跨语言内容质量评估的维基百科文章语言无关建模
计算机与社会
2024-04-16 v1
摘要
维基百科是最大的免费知识网络库。志愿者编辑投入时间和精力在 300 多个语言版本中创建和扩展文章。由于文章的内容质量因文而异,编辑们也花费大量时间按照特定标准对文章进行评级。然而,鉴于维基百科不断变化的性质,保持这些评估的完整性和最新状态在很大程度上是不可能的。为了克服这一局限性,我们提出了一种用于对维基百科文章质量进行建模的新型计算框架。最先进的维基百科文章质量建模方法利用了带有特定语言特征的机器学习技术。相比之下,我们的框架基于从文章中提取的语言无关结构特征、一组通用权重以及特定于语言版本的归一化标准。因此,我们确保维基百科的所有语言版本都能从我们的框架中受益,即使是那些没有自己的质量评估方案的版本。使用该框架,我们构建了包含维基百科现有语言版本中所有文章所有修订版本的特征值和质量分数的数据集。我们提供了这些资源的描述性分析以及我们框架的基准测试。此外,我们讨论了可以使用这些数据集解决的潜在下游任务,这些数据集已公开发布供公众使用。
引用
@article{arxiv.2404.09764,
title = {Language-Agnostic Modeling of Wikipedia Articles for Content Quality Assessment across Languages},
author = {Paramita Das and Isaac Johnson and Diego Saez-Trumper and Pablo Aragón},
journal= {arXiv preprint arXiv:2404.09764},
year = {2024}
}
备注
Accepted at ICWSM-24