中文

基于蒸馏表示的任务导向对话智能体的零样本与少样本本地化

计算与语言 2023-02-21 v1

摘要

任务导向对话(ToD)智能体大多局限于少数几种广泛使用的语言,这主要是由于为每种语言获取训练数据的成本高昂。现有的低成本方法依赖于跨语言嵌入或简单的机器翻译,虽然节省了数据,但牺牲了大量准确性,并且在很大程度上无法创建可用的对话智能体。我们提出了自动化方法,利用源语言的 ToD 训练数据,在另一种没有训练数据(即零样本)或仅有少量训练集(即少样本)的目标语言中构建一个高质量的功能性对话智能体。与大多数先前仅关注对话状态跟踪(DST)的跨语言 ToD 工作不同,我们构建了一个端到端的智能体。我们展示了我们的方法缩小了 ToD 智能体在少样本与现有全样本方法之间的准确性差距。我们通过以下方式实现这一点:(1)改进对话数据表示,(2)改进实体感知机器翻译,以及(3)自动过滤噪声翻译。我们在最近的双语对话数据集 BiToD 上评估了我们的方法。在中英迁移中,在零样本设置下,我们的方法在任务成功率(TSR)和对话成功率(DSR)上分别达到了 46.7% 和 22.0%。在使用了目标语言 10% 数据的少样本设置下,我们将最先进水平分别提高了 15.2% 和 14.0%,与全样本训练的差距缩小到 5% 以内。

关键词

引用

@article{arxiv.2302.09424,
  title  = {Zero and Few-Shot Localization of Task-Oriented Dialogue Agents with a Distilled Representation},
  author = {Mehrad Moradshahi and Sina J. Semnani and Monica S. Lam},
  journal= {arXiv preprint arXiv:2302.09424},
  year   = {2023}
}

备注

Published in EACL 2023