一个英语文学中指代消解的标注数据集
计算与语言
2020-05-18 v2
摘要
我们在本工作中提出一个新的英语文学作品指代标注数据集,涵盖来自100部小说的210,532个词符中的29,103个提及。该数据集与此前指代数据集的不同之处在于,其所含文档平均长度(2,105.3词)是其他基准数据集(OntoNotes为463.7)的四倍,并包含文学中常见的困难指代问题实例。该数据集允许对指代消解任务进行跨域性能评估,并可对文档内长距离指代的特征进行分析。
引用
@article{arxiv.1912.01140,
title = {An Annotated Dataset of Coreference in English Literature},
author = {David Bamman and Olivia Lewke and Anya Mansoor},
journal= {arXiv preprint arXiv:1912.01140},
year = {2020}
}