聚合众包与自动判断以扩充面向小说与维基百科文本的指代参考语料库
计算与语言
2022-10-12 v1
摘要
尽管存在多个针对指代参考/共指标注的数据集,但即使是其中最大的数据集在规模、领域范围、指代现象覆盖以及所含文档大小方面也存在局限性。然而,迄今为止提出的扩大指代标注规模的方法并未产生能克服这些局限性的数据集。在本文中,我们介绍了一个通过“众包游戏”标注的指代参考语料库的新版本。此新版本的规模与现有的最大指代参考语料库相当,部分归功于玩家的大量活动,部分得益于使用一种新的“解析与聚合”范式,通过结合指代解析器与指代参考聚合方法来“补全”可标记标注。所提出的方法可被采用以在其他涉及众包游戏的项目中大幅加快标注时间。此外,该语料库涵盖了尚无同等规模数据集的体裁(小说与维基百科);它涵盖了单例与非指代表达;并包含大量长文档(长度 > 2K)。
引用
@article{arxiv.2210.05581,
title = {Aggregating Crowdsourced and Automatic Judgments to Scale Up a Corpus of Anaphoric Reference for Fiction and Wikipedia Texts},
author = {Juntao Yu and Silviu Paun and Maris Camilleri and Paloma Carretero Garcia and Jon Chamberlain and Udo Kruschwitz and Massimo Poesio},
journal= {arXiv preprint arXiv:2210.05581},
year = {2022}
}