中文

CATS:一个大规模高质量的实用中文答案到序列数据集

计算与语言 2023-06-21 v1

摘要

流行的数据到文本数据集中存在三个问题。首先,大规模数据集要么包含噪声,要么缺乏真实应用场景。其次,接近真实应用的数据集规模相对较小。最后,当前数据集偏向英语,而对其他语言探索不足。为了缓解这些局限性,在本文中,我们提出了CATS,一个大规模高质量的实用中文答案到序列数据集。该数据集旨在为实际TableQA系统中的答案生成文本描述。此外,为了弥合输入SQL与表格之间的结构鸿沟并建立更好的语义对齐,我们提出了一种统一图转换方法,为这两种混合知识资源建立联合编码空间,并将此任务转化为图到文本问题。实验结果证明了我们所提方法的有效性。对CATS的进一步分析证明了该数据集的高质量与挑战性。

关键词

引用

@article{arxiv.2306.11477,
  title  = {CATS: A Pragmatic Chinese Answer-to-Sequence Dataset with Large Scale and High Quality},
  author = {Liang Li and Ruiying Geng and Chengyang Fang and Bing Li and Can Ma and Rongyu Cao and Binhua Li and Fei Huang and Yongbin Li},
  journal= {arXiv preprint arXiv:2306.11477},
  year   = {2023}
}

备注

ACL 2023