解构以重构:一种面向开放域对话系统的可配置评估指标
计算与语言
2020-11-03 v1 人工智能
摘要
已有许多自动评估指标被提出,用于为开放域对话中回复的整体质量打分。一般而言,整体质量由多个方面构成,例如相关性、具体性与共情性,且各方面的重要性随任务而异。例如,在具体点餐对话任务中具体性必不可少,而在语言教学对话系统中流畅性更受青睐。然而,现有指标并未被设计以应对此类灵活性。例如,BLEU 分数基本仅依赖词重叠,而 BERTScore 依赖参考回复与候选回复间的语义相似度。因此,它们无法保证捕捉所需方面,即具体性。为设计灵活适配任务的指标,我们首先提出将这些性质归为三组以便管理:可理解性、合理性与喜爱度,其中喜爱度是对任务至关重要的性质之组合。我们还提出一种简单方法,将各方面指标合成为单一指标,称为 USL-H,即层级化的可理解性(Understandability)、合理性(Sensibleness)与喜爱度(Likability)。我们证明 USL-H 分数与人类判断具有良好相关性,且保持针对不同方面与指标的可配置性。
引用
@article{arxiv.2011.00483,
title = {Deconstruct to Reconstruct a Configurable Evaluation Metric for Open-Domain Dialogue Systems},
author = {Vitou Phy and Yang Zhao and Akiko Aizawa},
journal= {arXiv preprint arXiv:2011.00483},
year = {2020}
}
备注
15 pages, 4 figures, 7 tables, Accepted to COLING 2020