PLOD:面向科学文献的缩写检测数据集
计算与语言
2022-05-02 v2
摘要
从非结构化文本中检测与抽取缩写有助于提升自然语言处理任务(如机器翻译与信息检索)的性能。然而,在公开可用数据集方面,尚不足以为训练基于深度神经网络的模型提供足以良好泛化于数据的数据。本文提出PLOD,一个用于缩写检测与抽取的大规模数据集,包含160k+自动标注了缩写及其完整形式(长形式)的片段。我们对一组实例进行了人工校验,并对该数据集进行了完整的自动校验。随后我们利用它生成了若干用于检测缩写与长形式的基线模型。最佳模型在缩写上取得0.92的F1-score,在检测对应长形式上取得0.89。我们在 https://github.com/surrey-nlp/PLOD-AbbreviationDetection 公开发布该数据集及我们的代码与所有模型。
引用
@article{arxiv.2204.12061,
title = {PLOD: An Abbreviation Detection Dataset for Scientific Documents},
author = {Leonardo Zilio and Hadeel Saadany and Prashant Sharma and Diptesh Kanojia and Constantin Orăsan},
journal= {arXiv preprint arXiv:2204.12061},
year = {2022}
}
备注
Accepted at LREC 2022, 8 pages