中文

面向文档驱动对话的版式感知信息抽取:数据集、方法与演示

计算与语言 2022-07-15 v1 多媒体

摘要

构建文档驱动的对话系统已受到越来越多的关注,因为文档承载着丰富的人类知识并普遍存在于企业中。其中,如何理解与检索文档中的信息是一个具有挑战性的研究问题。以往工作忽略文档的视觉属性并将其视为纯文本,导致模态不完整。本文提出一个版式感知的文档级信息抽取数据集 LIE,以促进从视觉丰富文档 (VRDs) 中抽取结构与语义知识的研究,从而在对话系统中生成准确回复。LIE 包含来自产品与官方文档中 4,061 页的三种抽取任务的 62k 标注,据我们所知成为最大的基于 VRD 的信息抽取数据集。我们还开发了将基于词元 (token) 的语言模型扩展以像人类一样考虑版式特征的基准方法。实证结果表明版式对于基于 VRD 的抽取至关重要,系统演示也验证了抽取的知识可帮助定位用户关心的答案。

关键词

引用

@article{arxiv.2207.06717,
  title  = {Layout-Aware Information Extraction for Document-Grounded Dialogue: Dataset, Method and Demonstration},
  author = {Zhenyu Zhang and Bowen Yu and Haiyang Yu and Tingwen Liu and Cheng Fu and Jingyang Li and Chengguang Tang and Jian Sun and Yongbin Li},
  journal= {arXiv preprint arXiv:2207.06717},
  year   = {2022}
}

备注

Accepted to ACM Multimedia (MM) Industry Track 2022