校准概念与操作:面向真实图像的符号推理
计算机视觉与模式识别
2021-10-04 v1 计算与语言
摘要
尽管神经符号方法在合成图像的视觉问答中表现出令人印象深刻的性能,其在真实图像上的表现却大打折扣。我们指出,真实数据中视觉概念的长尾分布与推理步骤重要性的不均衡是限制模型现实潜力的两个关键障碍。为应对这些挑战,我们提出一种新范式——校准概念与操作(CCO),使神经符号模型能够捕捉底层数据特征并以分层重要性进行推理。具体而言,我们引入一个带有可学习概念嵌入幅度的执行器以处理分布不平衡,以及一个操作校准器以突出重要操作并抑制冗余操作。我们的实验表明 CCO 大幅提升了神经符号方法在真实图像上的性能。通过在真实世界数据集 GQA 上评估模型,CCO 使神经符号方法 NSCL 较其原始版本提升 9.1%(从 47.0% 到 56.1%);该结果也大幅缩小了符号与非符号方法间的性能差距。此外,我们构建了一个扰动测试集,以更好地理解和分析模型在真实图像上的表现。代码见 https://github.com/Lizw14/CaliCO.git 。
引用
@article{arxiv.2110.00519,
title = {Calibrating Concepts and Operations: Towards Symbolic Reasoning on Real Images},
author = {Zhuowan Li and Elias Stengel-Eskin and Yixiao Zhang and Cihang Xie and Quan Tran and Benjamin Van Durme and Alan Yuille},
journal= {arXiv preprint arXiv:2110.00519},
year = {2021}
}
备注
To appear in ICCV2021; Code at https://github.com/Lizw14/CaliCO.git