WikiSQE:维基百科句子质量评估的大规模数据集
计算与语言
2024-01-02 v2
摘要
维基百科可以被任何人编辑,因此包含各种质量的句子。因此,维基百科包含一些低质量编辑,这些编辑通常会被其他编辑者标记。虽然编辑者的审查提高了维基百科的可信度,但很难检查所有已编辑的文本。协助这一过程非常重要,但目前尚不存在用于研究该问题的大型综合数据集。在此,我们提出了 WikiSQE,这是第一个用于维基百科句子质量评估的大规模数据集。每个句子均提取自英文维基百科的完整修订历史,并仔细调查和选择了目标质量标签。WikiSQE 包含约 340 万个句子和 153 个质量标签。在使用具有竞争力的机器学习模型进行自动分类的实验中,发现存在引用、语法/语义或命题问题的句子更难被检测到。此外,通过人工标注,我们发现我们开发的模型表现优于众包工作者。WikiSQE 有望成为 NLP 中其他任务的宝贵资源。
引用
@article{arxiv.2305.05928,
title = {WikiSQE: A Large-Scale Dataset for Sentence Quality Estimation in Wikipedia},
author = {Kenichiro Ando and Satoshi Sekine and Mamoru Komachi},
journal= {arXiv preprint arXiv:2305.05928},
year = {2024}
}
备注
AAAI 2024 Main Track Accepted