中文

开放域问答中口语与视觉解释的人工评估

计算与语言 2021-01-01 v1

摘要

尽管关于向用户解释开放域问答系统(ODQA)预测的研究日益增多,多数工作未能评估解释在多大程度上提升了用户信任。少数通过用户研究评估解释的工作,所采用的设置可能偏离终端用户实际使用情况:ODQA在语音助手最为普及,然而当前研究仅使用视觉显示评估解释,并可能错误地将关于最优解释的结论外推至其他模态。为缓解这些问题,我们开展了用户研究,衡量解释是否帮助用户正确决定是否接受或拒绝ODQA系统的答案。不同于先前工作,我们控制解释模态,例如通过口语或视觉界面传达给用户,并对比跨模态的有效性。结果显示,基于检索证据段落导出的解释在各模态上均可优于强基线(校准置信度),但最佳解释策略实际上随模态变化。我们展示了当前解释的常见失败案例,强调解释的端到端评估,并警示不要在异于部署环境的代理模态中评估解释。

关键词

引用

@article{arxiv.2012.15075,
  title  = {Human Evaluation of Spoken vs. Visual Explanations for Open-Domain QA},
  author = {Ana Valeria Gonzalez and Gagan Bansal and Angela Fan and Robin Jia and Yashar Mehdad and Srinivasan Iyer},
  journal= {arXiv preprint arXiv:2012.15075},
  year   = {2021}
}

备注

pre-print