中文

低通滤波提升视觉模型的行为对齐性

计算机视觉与模式识别 2026-02-17 v1

摘要

尽管深度神经网络(DNN)在计算机视觉基准测试中表现卓越,但仍不足以充分建模人类视觉行为,如错误一致性和形状偏差。最近的研究假设,通过\emph{生成式}而非\emph判别式}分类器可大幅提升行为对齐性,这对人类视觉模型具有深远影响。本文则表明,生成式模型行为对齐性的提升主要可归因于一种看似微不足道的操作:在生成式模型中对图像进行调整大小,从而实际上起到低通滤波的作用。在一系列受控实验中,我们表明,从判别模型(如 CLIP)中移除高频空间信息可显著提升其行为对齐性。仅对测试时刻对图像进行模糊处理——而非在训练时进行模糊处理——即可在模型与人类观察者的基准测试中取得新纪录,使当前的对齐差距减半。进一步表明,低通滤波器可能是最优解,我们通过直接优化滤波器以实现对齐来证明这一点。为阐释最优滤波器的性能,我们计算了该基准测试中所有可能的帕累托最优解的前沿,这以前是未知的。我们通过观察最优高斯滤波器的频谱大致匹配人类视觉系统中带通滤波器的频谱来解释我们的发现。我们表明,对比灵敏函数——即描述人类检测为 sinusoid 条纹所需对比度阈值随空间时间频率的倒数——其对特定宽度的高斯滤波器(该宽度也最大化了错误一致性)的近似效果良好。

关键词

引用

@article{arxiv.2602.13859,
  title  = {Low-Pass Filtering Improves Behavioral Alignment of Vision Models},
  author = {Max Wolff and Thomas Klein and Evgenia Rusak and Felix Wichmann and Wieland Brendel},
  journal= {arXiv preprint arXiv:2602.13859},
  year   = {2026}
}

备注

10 pages, 6 figures