中文

面向表格问答的韩语专用数据集

计算与语言 2022-05-03 v2

摘要

现有的问答系统主要聚焦于处理文本数据。然而,每天产生的许多数据以表格形式存储,可见于文档、关系型数据库或网页中。为解决表格上的问答任务,存在许多英文的表格问答数据集,但韩语数据集很少。在本文中,我们展示了如何构建面向表格问答的韩语专用数据集:韩语表格数据集是包含140万张表格及其对应描述的集合,用于无监督预训练语言模型。韩语表格问答语料库由众包工作者创建的7万对问答组成。随后,我们基于Transformer构建预训练语言模型,并利用这些数据集对模型进行微调以用于表格问答。接着我们报告了模型的评估结果。我们通过GitHub仓库公开这些数据集,并希望这些数据集能有助于表格问答及表格格式转换的进一步研究。

关键词

引用

@article{arxiv.2201.06223,
  title  = {Korean-Specific Dataset for Table Question Answering},
  author = {Changwook Jun and Jooyoung Choi and Myoseop Sim and Hyun Kim and Hansol Jang and Kyungkoo Min},
  journal= {arXiv preprint arXiv:2201.06223},
  year   = {2022}
}

备注

7 pages including references and 4 figures