开放域问答中口语与视觉解释的人工评估
计算与语言
2021-01-01 v1
摘要
尽管关于向用户解释开放域问答系统(ODQA)预测的研究日益增多,多数工作未能评估解释在多大程度上提升了用户信任。少数通过用户研究评估解释的工作,所采用的设置可能偏离终端用户实际使用情况:ODQA在语音助手最为普及,然而当前研究仅使用视觉显示评估解释,并可能错误地将关于最优解释的结论外推至其他模态。为缓解这些问题,我们开展了用户研究,衡量解释是否帮助用户正确决定是否接受或拒绝ODQA系统的答案。不同于先前工作,我们控制解释模态,例如通过口语或视觉界面传达给用户,并对比跨模态的有效性。结果显示,基于检索证据段落导出的解释在各模态上均可优于强基线(校准置信度),但最佳解释策略实际上随模态变化。我们展示了当前解释的常见失败案例,强调解释的端到端评估,并警示不要在异于部署环境的代理模态中评估解释。
引用
@article{arxiv.2012.15075,
title = {Human Evaluation of Spoken vs. Visual Explanations for Open-Domain QA},
author = {Ana Valeria Gonzalez and Gagan Bansal and Angela Fan and Robin Jia and Yashar Mehdad and Srinivasan Iyer},
journal= {arXiv preprint arXiv:2012.15075},
year = {2021}
}
备注
pre-print