MultiCite:建模真实引文需超越单句单标签设定
计算与语言
2021-08-03 v2
摘要
引文语境分析(CCA)是自然语言处理中的一项重要任务,研究学者如何以及为何讨论彼此的工作。尽管已有数十年的研究,传统的 CCA 框架在很大程度上依赖于对作者引文行为过于简化的假设,忽略了若干重要现象。例如,学术文献常包含对引证工作的丰富讨论,这些讨论跨越多个句子并同时表达多种意图。然而,CCA 通常被视为单句单标签分类任务,因此现有数据集未能捕捉这一有趣的语篇。在我们的工作中,我们通过提出一种将 CCA 作为文档级语境抽取与标注任务的新框架来解决这一研究空白。我们发布了 MultiCite,一个来自 1200 余篇计算语言学论文的 12,653 条引文语境的新数据集。它不仅是迄今最大的专家标注引文语境集合,MultiCite 还包含完整论文文本中的多句、多标签引文语境。最后,我们展示了我们的数据集虽然仍可用于训练经典 CCA 模型,也支持开发超越固定宽度文本分类的新型 CCA 模型。我们在 https://github.com/allenai/multicite 发布了代码与数据集。
引用
@article{arxiv.2107.00414,
title = {MultiCite: Modeling realistic citations requires moving beyond the single-sentence single-label setting},
author = {Anne Lauscher and Brandon Ko and Bailey Kuehl and Sophie Johnson and David Jurgens and Arman Cohan and Kyle Lo},
journal= {arXiv preprint arXiv:2107.00414},
year = {2021}
}