中文

F1 不够!面向以用户为中心的可解释问答的模型与评估

计算与语言 2020-10-14 v1

摘要

可解释问答系统预测一个答案以及展示为何选择该答案的解释。其目标是使用户能够评估系统的正确性并理解其推理过程。然而,我们表明当前的模型和评估设置存在关于答案与解释耦合方面的缺陷,这可能导致用户体验中的严重问题。作为补救,我们提出了一种层次化模型和一个新的正则化项来加强答案-解释耦合,以及两个评估分数来量化该耦合。我们在 HOTPOTQA 基准数据集上进行实验并开展了用户研究。用户研究表明,我们的模型提升了用户判断系统正确性的能力,并且像 F1 这样的分数不足以估计在有人类用户的实际设置中模型的实用性。我们的分数与用户体验更为一致,使其成为模型设计的有前景的候选指标。

关键词

引用

@article{arxiv.2010.06283,
  title  = {F1 is Not Enough! Models and Evaluation Towards User-Centered Explainable Question Answering},
  author = {Hendrik Schuff and Heike Adel and Ngoc Thang Vu},
  journal= {arXiv preprint arXiv:2010.06283},
  year   = {2020}
}

备注

EMNLP 2020