CoCo:用于评估对话状态跟踪器的可控反事实
计算与语言
2021-03-29 v3
摘要
对话状态跟踪器在基准数据集上已取得显著进展,但其在超出留出对话的新颖且真实场景下的泛化能力尚不明晰。我们提出可控反事实(CoCo)以弥补这一差距,并在新颖场景下评估对话状态跟踪(DST)模型,即:若用户以不同但仍符合对话流的方式回应,系统是否能成功处理该请求?CoCo 利用回合级信念状态作为反事实条件,通过两步生成新颖对话场景:(i)在回合级通过删除和添加槽位并替换槽值来生成反事实目标,(ii)以(i)为条件且与对话流一致地生成反事实对话。在 MultiWOZ 数据集上用 CoCo 生成的反事实评估最先进的 DST 模型,导致其绝对联合目标准确率显著下降多达 30.8%(从 49.4% 降至 18.6%)。相比之下,释义等广泛使用的方法至多仅影响准确率 2%。人工评估显示,COCO 生成的对话以超过 95% 的准确率完美反映底层用户目标,且与原始对话一样具有人类自然度,进一步强化了其为可靠且有前景的 DST 模型鲁棒性评估组成部分的潜力。
引用
@article{arxiv.2010.12850,
title = {CoCo: Controllable Counterfactuals for Evaluating Dialogue State Trackers},
author = {Shiyang Li and Semih Yavuz and Kazuma Hashimoto and Jia Li and Tong Niu and Nazneen Rajani and Xifeng Yan and Yingbo Zhou and Caiming Xiong},
journal= {arXiv preprint arXiv:2010.12850},
year = {2021}
}
备注
ICLR 2021