StRE:维基百科中基于自注意的编辑质量预测
社会与信息网络
2019-06-12 v1 神经与进化计算
摘要
鉴于其若干项目每分钟所增删内容的庞大数量,维基百科很容易被视作一个巨兽。这在自然语言处理领域为开发内容审核与审阅的自动化工具创造了巨大空间。本文提出自注意修订编码器(StRE),其利用词法单元的字形相似性来预测新编辑的质量。与主要使用页面声誉、编辑者活跃度或基于规则的启发式等特征的已有方案不同,我们利用编辑的文本内容包括我们认为蕴含更优质量特征的信息。更具体地,我们部署深度编码器从编辑文本内容生成表示,并据此推断质量。我们进一步贡献了一个包含 32K 个维基百科页面上 21M 次修订的新数据集,并证明 StRE 以至少 17%、至多 103% 的显著幅度优于现有方法。我们的预训练模型在仅对某一维基页面中 20% 的编辑进行再训练后即取得该结果。据我们所知,这也是首次尝试将深度语言模型用于维基百科中自动内容审核与审阅这一庞大领域。
引用
@article{arxiv.1906.04678,
title = {StRE: Self Attentive Edit Quality Prediction in Wikipedia},
author = {Soumya Sarkar and Bhanu Prakash Reddy and Sandipan Sikdar and Animesh Mukherjee},
journal= {arXiv preprint arXiv:1906.04678},
year = {2019}
}
备注
Accepted in ACL 2019 , 9 pages