基准测试低估了多语言对话代理的准备就绪程度
计算与语言
2024-06-18 v2
摘要
由于训练数据获取成本高昂,构建多语言任务导向对话 (TOD) 代理面临很大挑战。跟随提高训练数据效率的研究趋势,我们首次表明,基于情境学习对多语言 TOD 足够。为处理具有挑战性的对话状态跟踪 (DST) 子任务,我们将其分解为更适合情境学习的简单步骤,其中仅使用少量 few-shot 示例。我们在具有 12 个领域的多语言 TOD 数据集 X-RiSAWOZ 上进行测试,该数据集包含中文、英文、法文、韩文、日文和混合日英文本。我们在 6 种语言上的逐轮 DST 准确率范围为 55.6% 到 80.3%,似乎低于微调模型的 SOTA 结果(60.7% 到 82.8%);在响应生成 (RG) 子任务上的 BLEU 分数也显著低于 SOTA。然而,经过对验证集进行人工评估,我们发现通过纠正金标错误和改进数据集标注模式,GPT-4 配合我们的提示可实现 (1) DST 准确率 89.6% 到 96.8%,(2) 跨不同语言的响应生成准确率超过 99%。这让我们得出结论,当前的自动评估指标严重低估了基于情境学习的有效性。
引用
@article{arxiv.2405.17840,
title = {Benchmarks Underestimate the Readiness of Multi-lingual Dialogue Agents},
author = {Andrew H. Lee and Sina J. Semnani and Galo Castillo-López and Gäel de Chalendar and Monojit Choudhury and Ashna Dua and Kapil Rajesh Kavitha and Sungkyun Kim and Prashant Kodali and Ponnurangam Kumaraguru and Alexis Lombard and Mehrad Moradshahi and Gihyun Park and Nasredine Semmar and Jiwon Seo and Tianhao Shen and Manish Shrivastava and Deyi Xiong and Monica S. Lam},
journal= {arXiv preprint arXiv:2405.17840},
year = {2024}
}