CNN与Transformer对混合图像的感知与人类相似
计算机视觉与模式识别
2022-03-23 v1 人工智能
摘要
混合图像是一种生成具有两种解释的图像的技术,这两种解释会随着观察距离的变化而改变。它已被用于研究人类视觉系统对图像的多尺度处理。使用跨越10个水果类别的63,000张混合图像,我们在此表明,深度学习视觉模型的预测在定性上与人类对这些图像的感知相匹配。我们的结果提供了又一项支持该假设的证据,即卷积神经网络和Transformer善于对视觉皮层腹侧流中的信息前馈扫掠进行建模。代码和数据可在 https://github.com/aliborji/hybrid_images.git 获取。
关键词
引用
@article{arxiv.2203.11678,
title = {CNNs and Transformers Perceive Hybrid Images Similar to Humans},
author = {Ali Borji},
journal= {arXiv preprint arXiv:2203.11678},
year = {2022}
}