中文

MultiWOZ中的标注不一致与实体偏差

计算与语言 2022-02-16 v4

摘要

MultiWOZ是最受欢迎的多领域任务型对话数据集之一,包含覆盖八个领域的10K+标注对话。它已被广泛接受为各种对话任务的基准,例如对话状态跟踪(DST)、自然语言生成(NLG)和端到端(E2E)对话建模。在这项工作中,我们识别出数据集中一个被忽视的对话状态标注不一致问题,即一种槽位类型在相似对话中被不一致地标注,导致DST建模的混淆。我们针对这一存在于高达70%对话中的问题提出了自动修正方法。此外,我们注意到数据集中存在显著的实体偏差(例如,“cambridge”出现在train领域中50%的目的地城市)。该实体偏差可能导致生成模型中的命名实体记忆,而由于测试集也存在类似的实体偏差,这可能不被察觉。我们发布了一个将所有实体替换为未见过实体的新测试集。最后,我们在这些修改版本的数据上基准测试了最先进DST基线的联合目标准确率(JGA)。我们的实验表明,标注不一致修正带来了7-10%的JGA提升。另一方面,当模型在带有未见过实体的新测试集上评估时,我们观察到JGA下降了29%。

关键词

引用

@article{arxiv.2105.14150,
  title  = {Annotation Inconsistency and Entity Bias in MultiWOZ},
  author = {Kun Qian and Ahmad Beirami and Zhouhan Lin and Ankita De and Alborz Geramifard and Zhou Yu and Chinnadhurai Sankar},
  journal= {arXiv preprint arXiv:2105.14150},
  year   = {2022}
}

备注

Accepted by SIGDIAL 2021