利用预训练语言模型生成学术文档中的表格标题
计算与语言
2021-08-19 v1
摘要
本文解决学术文档中表格标题生成问题,此类标题常需要表格之外的附加信息。为此,我们提出一种方法:从论文正文中检索相关句子,并将表格内容以及检索到的句子输入预训练语言模型(如 T5 和 GPT-2)以生成表格标题。本文的贡献为:(1)讨论学术文档表格标题生成的挑战;(2)构建公开可用的数据集 DocBank-TB;(3)比较学术文档标题生成方法中从论文正文检索相关句子的不同策略。实验结果表明,T5 是该任务更优的生成模型,其在 BLEU 和 METEOR 上优于 GPT-2,意味着生成文本更清晰准确。此外,输入与行表头或整个表格匹配的相关句子是有效的。
引用
@article{arxiv.2108.08111,
title = {Table Caption Generation in Scholarly Documents Leveraging Pre-trained Language Models},
author = {Junjie H. Xu and Kohei Shinden and Makoto P. Kato},
journal= {arXiv preprint arXiv:2108.08111},
year = {2021}
}