CATS:一个大规模高质量的实用中文答案到序列数据集
计算与语言
2023-06-21 v1
摘要
流行的数据到文本数据集中存在三个问题。首先,大规模数据集要么包含噪声,要么缺乏真实应用场景。其次,接近真实应用的数据集规模相对较小。最后,当前数据集偏向英语,而对其他语言探索不足。为了缓解这些局限性,在本文中,我们提出了CATS,一个大规模高质量的实用中文答案到序列数据集。该数据集旨在为实际TableQA系统中的答案生成文本描述。此外,为了弥合输入SQL与表格之间的结构鸿沟并建立更好的语义对齐,我们提出了一种统一图转换方法,为这两种混合知识资源建立联合编码空间,并将此任务转化为图到文本问题。实验结果证明了我们所提方法的有效性。对CATS的进一步分析证明了该数据集的高质量与挑战性。
引用
@article{arxiv.2306.11477,
title = {CATS: A Pragmatic Chinese Answer-to-Sequence Dataset with Large Scale and High Quality},
author = {Liang Li and Ruiying Geng and Chengyang Fang and Bing Li and Can Ma and Rongyu Cao and Binhua Li and Fei Huang and Yongbin Li},
journal= {arXiv preprint arXiv:2306.11477},
year = {2023}
}
备注
ACL 2023