中文

用于构建码混合面向目标对话系统的数据集

计算与语言 2018-06-18 v1

摘要

对能够协助用户完成订票、餐厅预订、购物等各类日常活动的面向目标对话系统的需求日益增长。现有用于构建此类对话系统的数据集大多聚焦于单语对话,关于多语和/或码混合对话的工作几乎空白。因此这类数据集和系统无法服务于印度等世界上的多语地区,在那里人们普遍使用多种语言并无缝切换,从而产生码混合对话。例如,一名说印地语的用户想预订餐厅时通常会问:“Kya tum is restaurant mein ek table book karne mein meri help karoge?”(“你能帮我在这家餐厅订张桌子吗?”)。为促进此类码混合对话模型的开发,我们构建了一个包含码混合对话的面向目标对话数据集。具体而言,我们取自 DSTC2 餐厅预订数据集的文本,并生成其印地语-英语、孟加拉语-英语、古吉拉特语-英语和泰米尔语-英语的码混合版本。我们还利用现有 SOTA 模型在该数据集上建立了初步基线。该数据集及我们的基线实现已公开供研究使用。

关键词

引用

@article{arxiv.1806.05997,
  title  = {A Dataset for Building Code-Mixed Goal Oriented Conversation Systems},
  author = {Suman Banerjee and Nikita Moghe and Siddhartha Arora and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:1806.05997},
  year   = {2018}
}

备注

15 pages, 2 figures, 10 tables, Accepted in COLING - 2018