PreCo:面向指代消解的儿童词汇大规模数据集
计算与语言
2018-10-24 v1 人工智能
机器学习
摘要
我们介绍了 PreCo,一个用于指代消解的大规模英文数据集。该数据集旨在通过缓解训练集与测试集间低重叠的挑战,并支持对提及检测与提及聚类的分离分析,来体现指代消解中的核心挑战,如实体表示。为了增强训练-测试重叠,我们收集了约 38K 篇文档和 1240 万词的大型语料库,其大多来自英语国家学龄前儿童的词汇。实验表明,在更高的训练-测试重叠下,PreCo 上的错误分析比在现有流行数据集 OntoNotes 上更为高效。此外,我们标注了单例提及,使得首次能够量化提及检测器对指代消解性能的影响。该数据集可在 https://preschool-lab.github.io/PreCo/ 免费获取。
引用
@article{arxiv.1810.09807,
title = {PreCo: A Large-scale Dataset in Preschool Vocabulary for Coreference Resolution},
author = {Hong Chen and Zhenhua Fan and Hao Lu and Alan L. Yuille and Shu Rong},
journal= {arXiv preprint arXiv:1810.09807},
year = {2018}
}
备注
EMNLP 2018