PRESTO:一个用于解析真实任务型对话的多语言数据集
计算与语言
2023-03-20 v2
摘要
随着 Google Assistant、Alexa 和 Siri 等系统在日常生活中变得无处不在,对任务型对话的研究兴趣与日俱增。然而,该领域学术研究的影响受限于缺乏能真实捕捉广泛用户痛点的数据集。为支持针对解析真实对话中若干更具挑战性方面的研究,我们推出 PRESTO,一个包含超过 55 万段人与虚拟助手之间上下文多语言对话的公开数据集。PRESTO 包含真实世界 NLU 任务中出现的各类挑战,如不流利、语码转换与修订。它是唯一提供如用户联系人与列表等结构化上下文的大规模人工生成对话解析数据集。我们基于 mT5 模型的基线表明,PRESTO 中存在的对话现象难以建模,且在低资源设定下尤为显著。
引用
@article{arxiv.2303.08954,
title = {PRESTO: A Multilingual Dataset for Parsing Realistic Task-Oriented Dialogs},
author = {Rahul Goel and Waleed Ammar and Aditya Gupta and Siddharth Vashishtha and Motoki Sano and Faiz Surani and Max Chang and HyunJeong Choe and David Greene and Kyle He and Rattima Nitisaroj and Anna Trukhina and Shachi Paul and Pararth Shah and Rushin Shah and Zhou Yu},
journal= {arXiv preprint arXiv:2303.08954},
year = {2023}
}
备注
PRESTO v1 Release