ezCoref:迈向指代消解统一标注指南
计算与语言
2022-10-14 v1
摘要
大规模高质量语料库对推动指代消解研究至关重要。然而,现有数据集在指代的定义上各不相同,且通过为语言专家制定的复杂冗长指南收集。这些问题引发了研究者日益浓厚的兴趣,以策划一套适合不同背景标注者的统一指南。本工作中,我们开发了面向众包的指代标注方法 ezCoref,包含一个标注工具与交互式教程。我们使用 ezCoref 重新标注了来自七个现有英文指代数据集(涵盖小说、新闻及多个其他领域)的 240 段文本,仅向标注者讲授这些数据集中处理方式一致的案例。令人惊讶的是,我们发现即便未经大量培训,已能获得合理质量的标注(众包与专家标注间一致性 >90%)。在仔细分析剩余分歧后,我们识别出存在标注者一致同意但现有数据集缺乏统一处理(如泛指代词、同位语)的语言现象。我们建议研究界在策划未来统一标注指南时重新审视这些现象。
引用
@article{arxiv.2210.07188,
title = {ezCoref: Towards Unifying Annotation Guidelines for Coreference Resolution},
author = {Ankita Gupta and Marzena Karpinska and Wenlong Zhao and Kalpesh Krishna and Jack Merullo and Luke Yeh and Mohit Iyyer and Brendan O'Connor},
journal= {arXiv preprint arXiv:2210.07188},
year = {2022}
}
备注
preprint (19 pages), code in https://github.com/gnkitaa/ezCoref