MultiWOZ中的标注不一致与实体偏差
计算与语言
2022-02-16 v4
摘要
MultiWOZ是最受欢迎的多领域任务型对话数据集之一,包含覆盖八个领域的10K+标注对话。它已被广泛接受为各种对话任务的基准,例如对话状态跟踪(DST)、自然语言生成(NLG)和端到端(E2E)对话建模。在这项工作中,我们识别出数据集中一个被忽视的对话状态标注不一致问题,即一种槽位类型在相似对话中被不一致地标注,导致DST建模的混淆。我们针对这一存在于高达70%对话中的问题提出了自动修正方法。此外,我们注意到数据集中存在显著的实体偏差(例如,“cambridge”出现在train领域中50%的目的地城市)。该实体偏差可能导致生成模型中的命名实体记忆,而由于测试集也存在类似的实体偏差,这可能不被察觉。我们发布了一个将所有实体替换为未见过实体的新测试集。最后,我们在这些修改版本的数据上基准测试了最先进DST基线的联合目标准确率(JGA)。我们的实验表明,标注不一致修正带来了7-10%的JGA提升。另一方面,当模型在带有未见过实体的新测试集上评估时,我们观察到JGA下降了29%。
引用
@article{arxiv.2105.14150,
title = {Annotation Inconsistency and Entity Bias in MultiWOZ},
author = {Kun Qian and Ahmad Beirami and Zhouhan Lin and Ankita De and Alborz Geramifard and Zhou Yu and Chinnadhurai Sankar},
journal= {arXiv preprint arXiv:2105.14150},
year = {2022}
}
备注
Accepted by SIGDIAL 2021