HyenaPixel:利用卷积实现全局图像上下文
计算机视觉与模式识别
2025-11-18 v2
摘要
在计算机视觉中,更大的有效感受野 (ERF) 通常与更好的性能相关。虽然注意力机制原生支持全局上下文,但其二次方复杂度限制了其在受益于高分辨率输入的任务中的应用。在本工作中,我们将 Hyena(一种基于卷积的注意力替代方案)从因果序列扩展到双向数据和二维图像空间。我们将 Hyena 的卷积核缩放至超过特征图尺寸,最大达 191191,以最大化 ERF,同时保持相对于像素数量的次二次方复杂度。我们将二维 Hyena(HyenaPixel)和双向 Hyena 集成到 MetaFormer 框架中。对于图像分类任务,HyenaPixel 和双向 Hyena 分别实现了 84.9% 和 85.2% 的具有竞争力的 ImageNet-1k top-1 准确率,且无需额外的训练数据,同时优于其他卷积网络和大核网络。将 HyenaPixel 与注意力机制结合可进一步提高准确率。我们将双向 Hyena 的成功归因于其能够在没有固定邻域定义的情况下学习依赖于数据的像素几何排列。下游任务的实验结果表明,具有大滤波器和固定邻域的 HyenaPixel 能带来更好的定位性能。
引用
@article{arxiv.2402.19305,
title = {HyenaPixel: Global Image Context with Convolutions},
author = {Julian Spravil and Sebastian Houben and Sven Behnke},
journal= {arXiv preprint arXiv:2402.19305},
year = {2025}
}