Multi2WOZ:面向任务型对话的鲁棒多语言数据集与对话式预训练
计算与语言
2022-05-24 v1
摘要
(多领域)任务型对话(TOD)的研究主要集中于英语,主要由于其他语言中鲁棒 TOD 数据集的匮乏,阻碍了对这一关键 NLP 应用领域的跨语言迁移的系统研究。在本工作中,我们引入 Multi2WOZ,一个新的多语言多领域 TOD 数据集,源自成熟的英语数据集 MultiWOZ,涵盖四种类型学上多样的语言:中文、德语、阿拉伯语和俄语。与同期工作不同,Multi2WOZ 包含目标语言中的黄金标准对话,可直接与英语数据集的开发和测试部分比较,从而能够对 TOD 的跨语言迁移性能进行可靠且可比的估计。随后我们引入一个新的预训练语言模型(PrLM)多语言对话专门化框架,旨在促进任意下游 TOD 任务的跨语言迁移。利用针对具体目标语言专门化的此类对话式 PrLM,我们在两个标准 TOD 任务上系统基准测试了若干零样本和少样本跨语言迁移方法:对话状态跟踪与回复检索。我们的实验表明,在大多数设置中,最佳性能需要结合(I)目标语言中的对话专门化与(ii)具体 TOD 任务的少样本迁移。最重要的是,我们展示了目标语言中的对话专门化能够实现针对下游 TOD 任务的极高样本效率的少样本迁移。
引用
@article{arxiv.2205.10400,
title = {Multi2WOZ: A Robust Multilingual Dataset and Conversational Pretraining for Task-Oriented Dialog},
author = {Chia-Chien Hung and Anne Lauscher and Ivan Vulić and Simone Paolo Ponzetto and Goran Glavaš},
journal= {arXiv preprint arXiv:2205.10400},
year = {2022}
}
备注
NAACL 2022