方向性混淆揭示人类与机器视觉中的差异归纳偏差:基于率失真几何
计算机视觉与模式识别
2026-05-15 v2 信息论
math.IT
神经元与认知
摘要
对于人类来说,鸟 Robin 似乎比 Robin 鸟 更像鸟,但这种非对称性是否也适用于机器视觉?人类和现代视觉模型在准确率上可以相互匹配,同时做出系统性不同的错误,错误发生的频率不同,但谁被误认给了谁不同。我们表明,这些方向性混淆揭示了准确率之外不可见的归纳偏差。我们使用在 12 种扰动类型下的自然图像分类任务中匹配的人类和深度神经网络响应,量化混淆矩阵中的非对称性,并将其组织与信息-错误权衡几何相关——即在扰动下系统在多大程度上高效地和优雅地泛化。我们发现,人类表现出广泛但微弱的跨类对称性,而深度视觉模型显示稀疏、强烈的方向性坍缩到少数主导类别。鲁棒性训练会减少整体非对称性幅度,但无法恢复这种人类类似的分布结构。生成式仿真进一步表明,这两种非对称性组织方式即使在相同准确率下也会以相反方向改变权衡几何,从而解释了相同标量非对称性分数如何反映根本不同的泛化策略。总之,这些结果确立了方向性混淆结构作为敏感、可解释的归纳偏差签名,准确率基于评估无法恢复。
引用
@article{arxiv.2604.21909,
title = {Directional Confusions Reveal Divergent Inductive Biases Through Rate-Distortion Geometry in Human and Machine Vision},
author = {Leyla Roksan Caglar and Pedro A. M. Mediano and Baihan Lin},
journal= {arXiv preprint arXiv:2604.21909},
year = {2026}
}