多跳推理真的可解释吗?面向推理可解释性的基准评测
人工智能
2021-09-10 v2
摘要
近年来,多跳推理被广泛研究以获得更可解释的链接预测。然而,我们在实验中发现这些模型给出的许多路径实际上并不合理,而关于其可解释性评估的工作却很少。本文提出一个统一框架,定量评估多跳推理模型的可解释性,以推动其发展。具体而言,我们定义了路径召回率、局部可解释性和全局可解释性三个指标用于评估,并设计了一种利用规则的可解释性分数近似计算这些指标的策略。此外,我们手动标注了所有可能的规则,并建立了一个用于检测多跳推理可解释性的基准(BIMR)。实验中,我们在该基准上运行了九个基线模型。实验结果表明,当前多跳推理模型的可解释性不尽如人意,距离基准给出的上界仍有很大差距。此外,基于规则的模型在性能和可解释性上均优于多跳推理模型,这为未来研究指明了一个方向,即应探究如何更好地将规则信息融入多跳推理模型。我们的代码和数据集可从 https://github.com/THU-KEG/BIMR 获取。
引用
@article{arxiv.2104.06751,
title = {Is Multi-Hop Reasoning Really Explainable? Towards Benchmarking Reasoning Interpretability},
author = {Xin Lv and Yixin Cao and Lei Hou and Juanzi Li and Zhiyuan Liu and Yichi Zhang and Zelin Dai},
journal= {arXiv preprint arXiv:2104.06751},
year = {2021}
}