基于凝视引导的学习:避免视觉分类中的捷径偏差
计算机视觉与模式识别
2025-04-09 v1
摘要
受人类视觉注意力的启发,深度神经网络广泛采用注意力机制,以学习针对具有挑战性的视觉分类任务中具有判别力的局部属性。然而,现有方法主要强调这些特征的表示,而忽略了其精确的局部化,这常导致由于捷径偏差而发生的误分类。当模型在迁移或分布外数据集上评估时,这一局限性尤为突出。相比之下,人类能够利用先验对象知识快速定位和比较细粒度属性,这一能力在复杂且取值范围大的分类场景中尤为关键。致力于此,我们引入 Gaze-CIFAR-10,一个人类凝视时间序列数据集,以及一个双序列凝视编码器,用于建模人类注意力在不同局部属性上的精确顺序局部化。同时,采用 Vision Transformer (ViT) 来学习图像内容的顺序表示。通过跨模态融合,我们的框架将人类凝视先验与机器推导的视觉序列相结合,有效纠正图像特征表示中的不准确局部化。广泛的定性和定量实验表明,凝视引导的认知线索显著提升了分类准确率。
引用
@article{arxiv.2504.05583,
title = {Gaze-Guided Learning: Avoiding Shortcut Bias in Visual Classification},
author = {Jiahang Li and Shibo Xue and Yong Su},
journal= {arXiv preprint arXiv:2504.05583},
year = {2025}
}
备注
10 pages, 5 figures, 3 tables, URL: https://szyyjl.github.io/eye_tracking_data.github.io/