跨语言评估 Wikidata 中来源质量:一种混合方法
人工智能
2021-09-21 v1 计算与语言
摘要
Wikidata 是网络上最重要的结构化数据来源之一,由全球志愿者社区构建。作为一个二次来源,其内容必须有可信的参考文献支持;这一点尤为重要,因为 Wikidata 明确鼓励编辑者为尚无广泛共识的声明添加内容,只要它们有参考文献佐证。然而,尽管内容与参考文献之间存在这种本质联系,Wikidata 系统性和保证其参考文献质量的能力仍然有限。为此,我们开展了一项混合方法研究,利用在线众包、描述性统计和机器学习,在不同语言下大规模确定 Wikidata 参考文献的相关性、可访问性和权威性。基于我们之前的工作,我们运行了一系列微任务实验来评估从带有多种语言标签的 Wikidata 三元组中抽样得到的大型参考文献语料库。我们使用经过整合、人工校订的众包评估来训练多个机器学习模型,以将分析扩展到整个 Wikidata。研究结果帮助我们确定了 Wikidata 中参考文献的质量,并识别出在定义和捕获网络上用户生成的多语言结构化数据质量方面的常见挑战。我们还讨论了正在进行的编辑实践,这些实践可以更直接地鼓励使用更高质量的参考文献。研究中使用的所有数据和代码均在 GitHub 上提供,以供研究界反馈、进一步改进和部署。
引用
@article{arxiv.2109.09405,
title = {Assessing the quality of sources in Wikidata across languages: a hybrid approach},
author = {Gabriel Amaral and Alessandro Piscopo and Lucie-Aimée Kaffee and Odinaldo Rodrigues and Elena Simperl},
journal= {arXiv preprint arXiv:2109.09405},
year = {2021}
}