Graphine:一个面向图感知术语定义生成的数据集
计算与语言
2021-09-10 v1
摘要
精确地定义术语是科学交流的第一步。开发用于定义生成的神经文本生成模型可以规避人工整理的劳动密集性,进一步加速科学发现。遗憾的是,大规模术语定义数据集的缺乏阻碍了定义生成的进程。本文提出了一个大规模术语定义数据集 Graphine,涵盖 2,010,648 对术语-定义对,横跨 227 个生物医学子学科。每个子学科中的术语进一步构成有向无环图,为开发图感知文本生成模型开辟了新途径。我们随后提出了一种新颖的图感知定义生成模型 Graphex,它将 Transformer 与图神经网络相结合。我们的模型通过利用术语的图结构,优于现有的文本生成模型。我们进一步展示了 Graphine 如何用于评估预训练语言模型、比较图表示学习方法以及预测句子粒度。我们期望 Graphine 成为生物医学领域定义生成及众多其他 NLP 任务的独特资源。
引用
@article{arxiv.2109.04018,
title = {Graphine: A Dataset for Graph-aware Terminology Definition Generation},
author = {Zequn Liu and Shukai Wang and Yiyang Gu and Ruiyi Zhang and Ming Zhang and Sheng Wang},
journal= {arXiv preprint arXiv:2109.04018},
year = {2021}
}
备注
EMNLP 2021