ApposCorpus:一个用于事实性同位语生成的多语言、多领域新数据集
计算与语言
2020-11-09 v1
摘要
新闻文章、图像描述、产品评论以及许多其他文本会提及人和组织,其名称识别度对不同受众可能不同。在这种情况下,关于命名实体的背景信息可以以同位名词短语的形式提供,或由人类撰写或自动生成。我们在先前同位语生成工作的基础上,给出了一个更新的、更贴近实际的端到端任务定义,并由一个涵盖四种语言(英语、西班牙语、德语和波兰语)、两类实体类型(人物和组织)以及两个领域(维基百科和新闻)的数据集实例化。我们对数据和任务进行了广泛分析,指出了其带来的各种建模挑战。我们使用标准语言生成方法所获得的结果表明,该任务确实非平凡,并且留有大量改进空间。
引用
@article{arxiv.2011.03287,
title = {The ApposCorpus: A new multilingual, multi-domain dataset for factual appositive generation},
author = {Yova Kementchedjhieva and Di Lu and Joel Tetreault},
journal= {arXiv preprint arXiv:2011.03287},
year = {2020}
}
备注
To appear at COLING2020