X-RiSAWOZ:高质量端到端多语言对话数据集与少样本智能体
计算与语言
2023-07-03 v1
摘要
任务型对话研究主要集中于英语和中文等少数流行语言,原因在于为新语言创建数据集的成本较高。为降低成本,我们对自动翻译的数据进行人工编辑。我们通过将中文 RiSAWOZ 翻译为 4 种语言:英语、法语、印地语、韩语;以及一种英印混码语言,创建了一个新的多语言基准 X-RiSAWOZ。X-RiSAWOZ 每种语言拥有超过 18,000 条人工核验的对话话语,且与多数多语言已有工作不同,它是用于构建全功能智能体的端到端数据集。我们在创建 X-RiSAWOZ 过程中遇到的诸多困难促使我们开发了一套工具集,以加速翻译后新语言数据集的后期编辑。该工具集通过结合神经与基于词典方法的混合实体对齐技术改进机器翻译,并配备多项自动化与半自动化校验。我们在目标语言仅有有限黄金数据的零样本与少样本设定下训练对话智能体,为 X-RiSAWOZ 建立了强基线。我们的结果表明,我们的翻译与后期编辑方法及工具集可用于高性价比地创建新的高质量多语言对话智能体。我们的数据集、代码与工具包均已开源发布。
引用
@article{arxiv.2306.17674,
title = {X-RiSAWOZ: High-Quality End-to-End Multilingual Dialogue Datasets and Few-shot Agents},
author = {Mehrad Moradshahi and Tianhao Shen and Kalika Bali and Monojit Choudhury and Gaël de Chalendar and Anmol Goel and Sungkyun Kim and Prashant Kodali and Ponnurangam Kumaraguru and Nasredine Semmar and Sina J. Semnani and Jiwon Seo and Vivek Seshadri and Manish Shrivastava and Michael Sun and Aditya Yadavalli and Chaobin You and Deyi Xiong and Monica S. Lam},
journal= {arXiv preprint arXiv:2306.17674},
year = {2023}
}
备注
Accepted by ACL 2023 Findings