中文

NLU++:面向任务型对话自然语言理解的多标签、槽位丰富、可泛化数据集

计算与语言 2022-05-06 v3 机器学习

摘要

我们提出了NLU++,一个用于任务型对话(ToD)系统中自然语言理解(NLU)的新型数据集,旨在为对话NLU模型提供一个更具挑战性的评估环境,以适应当前的应用和行业需求。NLU++分为两个领域(BANKING和HOTELS),并对当前常用的NLU数据集进行了几项关键改进。1) NLU++提供了细粒度的领域本体,包含大量具有挑战性的多意图句子,引入并验证了意图模块的概念,这些模块可以组合成传达复杂用户目标的复杂意图,并结合了更细粒度因而更具挑战性的槽位集。2) 本体被划分为领域特定和通用(即领域无关)的意图模块,这些模块跨领域重叠,促进了标注示例的跨领域可重用性。3) 数据集的设计灵感来源于工业ToD系统中观察到的问题,并且4) 它由对话NLU专家收集、过滤和仔细标注,产生了高质量的标注数据。最后,我们在NLU++上对一系列当前最先进的NLU模型进行了基准测试;结果证明了该数据集具有挑战性,尤其是在低数据情况下,验证了“意图模块化”的有效性,并呼吁对ToD NLU进行进一步研究。

关键词

引用

@article{arxiv.2204.13021,
  title  = {NLU++: A Multi-Label, Slot-Rich, Generalisable Dataset for Natural Language Understanding in Task-Oriented Dialogue},
  author = {Iñigo Casanueva and Ivan Vulić and Georgios P. Spithourakis and Paweł Budzianowski},
  journal= {arXiv preprint arXiv:2204.13021},
  year   = {2022}
}

备注

16 pages, 1 figure, 10 tables. Accepted in NAACL 2022 (Findings)