grounding 视觉解释
计算机视觉与模式识别
2018-08-03 v2
摘要
现有的视觉解释生成智能体学习流畅地论证一个类别预测。然而,它们可能提及反映强类别先验的视觉属性,尽管图像中实际并不存在该证据。这一点尤其令人担忧,因为此类智能体最终无法与人类用户建立信任。为克服该局限,我们提出一种短语评判模型,以精炼生成的候选解释,并辅以翻转短语作为训练时的负例。在推理时,我们的短语评判模型以图像和候选解释为输入,输出一个表明候选解释在图像中 grounding 程度的分数。我们的可解释 AI 智能体能够提供针对替代预测的反对论据(即反事实),以及证明正确分类决策的解释。我们的模型通过在 CUB 数据集上提及图像中 grounding 的短语,提升了细粒度分类决策的文本解释质量。此外,在 FOIL 任务上,我们的智能体可检测句子中的错误、定位不正确短语并显著优于其他模型地予以纠正。
引用
@article{arxiv.1807.09685,
title = {Grounding Visual Explanations},
author = {Lisa Anne Hendricks and Ronghang Hu and Trevor Darrell and Zeynep Akata},
journal= {arXiv preprint arXiv:1807.09685},
year = {2018}
}
备注
Accepted to ECCV 2018