用分解探针校准多跳问答系统的可信度
计算与语言
2022-11-02 v2
摘要
多跳问答(QA)是一项具有挑战性的任务,因为它需要准确聚合来自多个上下文段落的信息并透彻理解底层推理链。近期多跳 QA 的研究表明,先将问题分解为更简单的单跳问题可提升性能。本文从可解释 NLP 的角度探索多跳分解的另一种效用:通过用分解出的子问题探测神经 QA 模型来生成解释。我们假设,这样做可使用户更好地预测底层 QA 系统何时会给出正确答案。通过人类参与者研究,我们验证了向用户展示分解探针及探针答案能够提升其逐题实例预测系统性能的能力。我们表明分解是一种有效的 QA 系统探测形式,也是一种有前景的解释生成方法。深入分析显示了分解系统有待改进的需求。
引用
@article{arxiv.2204.07693,
title = {Calibrating Trust of Multi-Hop Question Answering Systems with Decompositional Probes},
author = {Kaige Xie and Sarah Wiegreffe and Mark Riedl},
journal= {arXiv preprint arXiv:2204.07693},
year = {2022}
}
备注
Accepted to EMNLP 2022 Findings