面向端到端任务型对话系统的过生成响应重排序
计算与语言
2022-12-20 v2
摘要
端到端(E2E)任务型对话(ToD)系统容易陷入所谓的“似然陷阱”,导致生成的响应枯燥、重复,且常与对话历史不一致。将多个生成响应的排序列表与评估数据中的“黄金响应”进行比较,可发现响应质量差异很大,许多优质响应排在列表较后的位置。本工作所解决的主要挑战在于:如何在推理时超越贪心生成的系统响应,即在无黄金响应可用的情况下,如何从系统初始过生成的响应列表中获取并挑选出此类高质量响应。为此,我们提出一种简单而有效的重排序方法,旨在从系统最初过生成的响应列表中筛选高质量项。其思路是利用任意序列级(相似性)打分函数,将响应的语义空间划分为高分与低分两个分区。在训练时,高分分区包含所有与黄金响应的相似度高于贪心响应与黄金响应相似度的生成响应。在推理时,目标是在仅给定先前对话历史的情况下,估计每个过生成响应属于高分分区的概率。我们在标准 MultiWOZ 数据集上验证了所提方法的鲁棒性与通用性:我们的方法将最先进的 E2E ToD 系统提升了 2.0 BLEU、1.6 ROUGE 和 1.3 METEOR 分数,取得了新的峰值结果。在 BiTOD 数据集上的额外实验与人工评估进一步确认了该框架的泛化性与有效性。
引用
@article{arxiv.2211.03648,
title = {Reranking Overgenerated Responses for End-to-End Task-Oriented Dialogue Systems},
author = {Songbo Hu and Ivan Vulić and Fangyu Liu and Anna Korhonen},
journal= {arXiv preprint arXiv:2211.03648},
year = {2022}
}
备注
23 pages, 10 figures