利用源自人类视觉系统与深度网络的视觉解释理解字符识别
计算机视觉与模式识别
2021-08-31 v2
摘要
人类观察者在分类视觉模式时进行选择性信息摄取。目前构成最佳人工视觉系统的深度神经网络也是如此。我们的目标是检验这两个系统在信息收集策略上的一致性或其缺失。我们将研究操作化为字符识别任务。我们使用眼动追踪通过注视图来测定人类信息热点的空间分布,并使用激活映射技术通过可视化图获得深度网络的类似分布。可视化图与注视图之间的定性比较揭示了一致性的有趣关联。深度学习模型关注了字符中与人类在正确分类字符情况下注视的相似区域。另一方面,当人类和深度网络关注的区域不同时,字符通常会被后者误分类。因此,我们提议将眼动追踪实验获得的视觉注视图作为监督输入,以对齐模型对相关字符区域的关注。我们发现这种监督显著提高了模型的性能,且不需要任何额外参数。这种方法有望在医学分析和监控等可解释性有助于确定系统保真度的各种领域中找到应用。
引用
@article{arxiv.2108.04558,
title = {Understanding Character Recognition using Visual Explanations Derived from the Human Visual System and Deep Networks},
author = {Chetan Ralekar and Shubham Choudhary and Tapan Kumar Gandhi and Santanu Chaudhury},
journal= {arXiv preprint arXiv:2108.04558},
year = {2021}
}