文本到表格:一种信息抽取的新范式
计算与语言
2022-03-17 v2
摘要
我们研究一种信息抽取(IE)的新问题设定,称为文本到表格(text-to-table)。在文本到表格中,给定一段文本,需创建一张或若干张表格来表达文本主要内容,而模型从文本-表格对数据中学习。该问题设定不同于现有IE方法。首先,抽取可从长文本到大且具有复杂结构的表格进行。其次,抽取完全由数据驱动,无需显式定义模式(schema)。据我们所知,此前尚无研究该问题的工作。本文中将文本到表格形式化为序列到序列(seq2seq)问题。我们首先采用从预训练语言模型微调的seq2seq模型来执行该任务。我们还在seq2seq方法内开发了新方法,利用表格生成中的两种附加技术:表格约束与表格关系嵌入。我们将文本到表格视为已被充分研究的表格到文本的逆问题,并在实验中利用四个现有表格到文本数据集进行文本到表格。实验结果显示,朴素seq2seq模型可胜过使用关系抽取与命名实体抽取的基线方法。结果还显示我们的方法能进一步提升朴素seq2seq模型的性能。我们进一步讨论了所提任务的主要挑战。代码与数据见 https://github.com/shirley-wu/text_to_table。
引用
@article{arxiv.2109.02707,
title = {Text-to-Table: A New Way of Information Extraction},
author = {Xueqing Wu and Jiacheng Zhang and Hang Li},
journal= {arXiv preprint arXiv:2109.02707},
year = {2022}
}
备注
ACL 2022