中文

从科学表格中学习用于文本生成的推理

计算与语言 2021-04-20 v1

摘要

本文中,我们引入 SciGen,一个用于推理感知的数据到文本生成任务的新挑战数据集,由科学文章中的表格及其对应描述组成。描述科学表格超越了对表格内容的表层实现,需要对表格数值进行推理。SciGen 的独特之处在于:(1)表格大多包含数值,(2)对应描述需要算术推理。因此,SciGen 是首个在复杂输入结构(即科学文章中的表格)上评估生成模型算术推理能力的数据集。我们研究了最先进的数据到文本生成模型在 SciGen 上的有效性,并使用常用指标及人工评估对结果进行了评价。我们的结果与分析表明:(a)尽管人类倾向于对科学表格描述进行推理,但最先进模型在此任务上的能力严重受限;(b)尽管增加训练数据能改善结果,但这并非推理感知文本生成的解决方案;(c)该任务的主要瓶颈之一是缺乏恰当的自动评价指标。用于人工评估的数据、代码与标注将发布于 https://github.com/UKPLab/SciGen。SciGen 为推理感知文本生成与评估的未来研究开辟了新途径。

关键词

引用

@article{arxiv.2104.08296,
  title  = {Learning to Reason for Text Generation from Scientific Tables},
  author = {Nafise Sadat Moosavi and Andreas Rücklé and Dan Roth and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2104.08296},
  year   = {2021}
}