VisFIS:基于正确理由目标的视觉特征重要性监督
计算机视觉与模式识别
2022-10-27 v2 人工智能
计算与语言
机器学习
摘要
许多以往工作旨在通过用人标注(如重要图像区域的高亮)监督特征重要性(由模型解释技术估计)来改进模型的视觉推理。然而,近期工作表明,在视觉问答(VQA)任务中,即便使用随机监督,特征重要性(FI)监督带来的性能提升依然存在,这意味着这些方法并未真正将模型 FI 与人类 FI 对齐。在本文中,我们表明,通过优化四个关键模型目标,模型 FI 监督可以切实提升 VQA 模型准确率以及多个正确理由(RRR)指标上的表现:(1) 在有限但充分的信息下准确预测(充分性);(2) 在无重要信息时的最大熵预测(不确定性);(3) 对不重要特征变化的预测不变性(不变性);(4) 模型 FI 解释与人类 FI 解释之间的一致性(合理性)。我们性能最佳的方法——视觉特征重要性监督(VisFIS)——在基准 VQA 数据集上,无论在分布内还是分布外准确率方面均优于强基线。尽管过去的研究认为准确率提升的机制是通过改进解释合理性,我们表明这种关系关键取决于解释忠实性(解释是否真实代表模型内部推理)。当解释合理且忠实时预测更准确,而当解释合理但不忠实时则不然。最后,我们表明,令人惊讶的是,在控制模型分布内准确率时,RRR 指标并不能预测分布外模型准确率,这引发了对这些指标用于评估模型推理价值性的质疑。所有支持代码见 https://github.com/zfying/visfis
引用
@article{arxiv.2206.11212,
title = {VisFIS: Visual Feature Importance Supervision with Right-for-the-Right-Reason Objectives},
author = {Zhuofan Ying and Peter Hase and Mohit Bansal},
journal= {arXiv preprint arXiv:2206.11212},
year = {2022}
}
备注
NeurIPS 2022 (first two authors contributed equally)