扰动但稳定:跨CNN、ViT和自监督ViT的人猫不变表征
计算机视觉与模式识别
2025-11-05 v1 人工智能
摘要
猫与人类眼部解剖结构存在差异。尤其,Felis Catus(家猫)具有垂直拉长的瞳孔,这与捕食性行为密切相关;然而,这些特殊化特征在下游视觉表征中的体现仍未完全理解。我们提出了一个统一的、冻结编码器基准,量化野生环境中猫人类跨物种表征对齐情况,涵盖卷积神经网络、监督式Vision Transformer、窗口式Transformer以及自监督ViT(DINO),采用层级中心核对齐(线性和RBF)和表征相似性分析,并附有论文中报告的其他分布性和稳定性测试。在所有模型中,DINO ViT-B/16实现了最显著的对齐(平均CKA-RBF≈0.814,平均CKA线性≈0.745,平均RSA≈0.698),且在早期模块处达到峰值,表明基于token的自监督可诱导跨物种统计特性的早期特征。监督式ViT在CKA上表现竞争力,但几何对应性较弱(例如ViT-B/16在block8处RSA≈0.53;ViT-L/16在block14处≈0.47),揭示了相似性与表征几何之间的深度依赖性差异。CNN仍为强基线,但低于普通ViT,窗口式Transformer表现不佳,暗示了架构归纳偏差对跨物种对齐的影响。结果表明,自监督学习结合ViT的归纳偏差可产生更贴近猫和人类视觉系统表征几何的特征,优于广泛使用的CNN和窗口式Transformer,为关于跨物种视觉计算在何处及如何收敛提供可检验的神经科学假设。我们发布代码和数据集供参考与可重复性使用。
引用
@article{arxiv.2511.02404,
title = {Purrturbed but Stable: Human-Cat Invariant Representations Across CNNs, ViTs and Self-Supervised ViTs},
author = {Arya Shah and Vaibhav Tripathi},
journal= {arXiv preprint arXiv:2511.02404},
year = {2025}
}