解释质量评估中的挑战
计算与语言
2023-03-10 v2 人工智能
人机交互
摘要
尽管大量研究聚焦于生成解释,但如何以有意义的方式评估所生成解释的质量仍不明确。当今主流方法是使用代理分数来量化解释,将解释与(人工标注的)标准解释进行比较。该方法假设达到更高代理分数的解释也能为人类用户带来更大益处。本文中,我们指出这一方法的问题。具体而言,我们(i)阐述了期望的解释质量特征,(ii)描述了当前评估实践如何违背这些特征,以及(iii)通过众包案例研究的初步证据支撑我们的论证,该研究中我们调查了最先进可解释问答系统的解释质量。我们发现代理分数与人类质量评分相关性很差,并且此外,其被使用越频繁就越缺乏区分度(即遵循古德哈特定律)。最后,我们提出指导方针,以实现有意义的解释评估,从而推动开发为人类用户提供切实益处的系统。
引用
@article{arxiv.2210.07126,
title = {Challenges in Explanation Quality Evaluation},
author = {Hendrik Schuff and Heike Adel and Peng Qi and Ngoc Thang Vu},
journal= {arXiv preprint arXiv:2210.07126},
year = {2023}
}
备注
41 pages, 11 figures