槽位非一语建成:基于子槽位的口语对话
计算与语言
2023-09-26 v1 人工智能
机器学习
摘要
槽位值可能在对话的多轮交互中逐段提供,尤其是对于电话号码和姓名等一些重要信息。这是日常生活中的常见现象,但以往工作很少关注。为填补空白,本文定义了一项新任务,称为基于子槽位的任务型对话(SSTOD),并构建了一个中文对话数据集 SSD 以推动 SSTOD 研究。该数据集包含来自四个不同领域(中文姓名、电话号码、身份证号和车牌号)共计 40K 对话和 500K utterance。数据已良好标注子槽位值、槽位值、对话状态和动作。我们发现了 SSTOD 中一些新的语言现象与交互方式,给构建该任务的对话智能体带来了关键挑战。我们在 SSTOD 上测试了三个最先进的对话模型,发现它们在四个领域上均不能很好地处理该任务。我们还以插件方式引入槽位知识,探究了一个改进模型。为满足 SSTOD 中广泛存在于实际应用的新挑战,还需开展更多工作。数据集与代码已公开于 https://github.com/shunjiu/SSTOD。
引用
@article{arxiv.2203.10759,
title = {A Slot Is Not Built in One Utterance: Spoken Language Dialogs with Sub-Slots},
author = {Sai Zhang and Yuwei Hu and Yuchuan Wu and Jiaman Wu and Yongbin Li and Jian Sun and Caixia Yuan and Xiaojie Wang},
journal= {arXiv preprint arXiv:2203.10759},
year = {2023}
}
备注
Accepted by ACL 2022 Findings