中文

多轮对话与其对话状态跟踪评价指标的不匹配

计算与语言 2022-04-01 v2 人工智能

摘要

对话状态跟踪(DST)旨在从多轮对话情境中提取关键信息并采取适当动作。信念状态作为核心信息之一,指主体及其具体内容,以领域-槽-值的形式出现。训练后的模型在每一轮预测“累积”的信念状态,联合目标准确率与槽准确率主要用于评估该预测;然而,我们指出当前评价指标在评估随对话推进而累积的信念状态时存在关键局限,尤其是在使用最广的MultiWOZ数据集中。此外,我们提出相对槽准确率以补充现有指标。相对槽准确率不依赖于预定义槽的数量,并通过依据各对话轮次赋予相对分数实现直观评估。本研究亦倡导在DST任务中除报告联合目标准确率外,还应报告多种补充指标,以实现 realistic 评估。

关键词

引用

@article{arxiv.2203.03123,
  title  = {Mismatch between Multi-turn Dialogue and its Evaluation Metric in Dialogue State Tracking},
  author = {Takyoung Kim and Hoonsang Yoon and Yukyung Lee and Pilsung Kang and Misuk Kim},
  journal= {arXiv preprint arXiv:2203.03123},
  year   = {2022}
}

备注

ACL 2022 (short)