StatCan 对话数据集:通过具有真实意图的对话检索数据表
计算与语言
2024-07-18 v2
摘要
我们介绍 StatCan 对话数据集,包含加拿大统计局工作人员与寻找已发布数据表的在线用户之间的 19,379 个对话轮次。这些对话源于真实意图,以英语或法语进行,并导致工作人员检索超过 5000 个复杂数据表之一。基于该数据集,我们提出两项任务:(1) 基于进行中的对话自动检索相关表格,以及 (2) 在每一轮自动生成恰当的客服回复。我们通过建立强基线来考察各项任务的难度。我们在时间数据划分上的实验表明,所有模型都难以泛化到未来对话,因为从验证集移到测试集时我们观察到两项任务的性能显著下降。此外,我们发现回复生成模型难以决定何时返回一个表格。考虑到这些任务对现有模型构成重大挑战,我们鼓励学界为我们的任务开发模型,其可直接用于帮助知识工作者为在线聊天用户查找相关表格。
引用
@article{arxiv.2304.01412,
title = {The StatCan Dialogue Dataset: Retrieving Data Tables through Conversations with Genuine Intents},
author = {Xing Han Lu and Siva Reddy and Harm de Vries},
journal= {arXiv preprint arXiv:2304.01412},
year = {2024}
}
备注
Accepted at EACL 2023