中文

CiteWorth:用于改进科学文档理解的引文价值检测

计算与语言 2021-05-26 v2 数字图书馆 机器学习

摘要

科学文档理解具有挑战性,因为数据高度领域特定且多样。然而,科学文本任务的标注数据集需要昂贵的手工标注,且往往规模小、局限于仅一个或少数几个领域。同时,科学文档包含许多潜在的训练信号,如引文,可用于构建大规模标注数据集。鉴于此,我们对英语中的引文价值检测展开深入研究,即标注一个句子是否引用了外部来源。为此,我们引入 CiteWorth,一个基于大规模提取纯文本科学文档构建的、上下文感知、经严格清洗的引文价值检测标注数据集。我们表明 CiteWorth 质量高、具挑战性,并适用于研究领域自适应等问题。我们性能最佳的引文价值检测模型是基于 Longformer 的段落级上下文感知句子标注模型,比仅考虑单个句子的 SciBERT 提高了 5 个 F1 点。最后,我们证明以引文价值作为辅助任务对语言模型进行微调可提升下游科学文档理解任务的性能。

关键词

引用

@article{arxiv.2105.10912,
  title  = {CiteWorth: Cite-Worthiness Detection for Improved Scientific Document Understanding},
  author = {Dustin Wright and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2105.10912},
  year   = {2021}
}

备注

12 pages, 9 tables, 1 figure