KAN-FPN-Stem:用于提升基于ViT的姿态估计的KAN增强特征金字塔干线
计算机视觉与模式识别
2025-12-30 v1
摘要
视觉变换器 (ViT) 在姿态估计等密集预测任务中展现出巨大的潜力。然而,其性能常受到诸如ViTPose等模型所采用的过于简单前端设计的制约。这种朴素的 patchification 机制难以有效处理多尺度变化,导致在初始特征提取阶段发生不可逆的信息损失。为克服这一限制,我们引入一种新颖的KAN增强FPN干线架构。通过严格的消融研究,我们首先确定,性能提升的真正瓶颈不在于插入式注意力模块(如CBAM),而在于FPN后融合的非线性平滑步骤中。在此基础上,我们的核心创新在于保留经典的"upsample-and-add"融合路径,但将FPN末端的标准线性3x3平滑卷积替换为强大的KAN-based卷积层。凭借其卓越的非线性建模能力,该KAN-based层自适应学习并纠正多尺度融合过程中产生的"artifacts"。在COCO数据集上的大量实验表明,我们的KAN-FPN-Stem相较于轻量级ViTPose-S基线实现了最高可达+2.0 AP的显著性能提升。这一工作不仅提供了即插即用且高性能的模块,更重要的是揭示了:ViT前端的性能瓶颈往往不在于"特征细化"(注意力),而在于"特征融合"(Fusion)的质量。同时,它通过引入KAN算子,为解决这一瓶颈提供了有效路径。
引用
@article{arxiv.2512.22228,
title = {KAN-FPN-Stem:A KAN-Enhanced Feature Pyramid Stem for Boosting ViT-based Pose Estimation},
author = {HaoNan Tang},
journal= {arXiv preprint arXiv:2512.22228},
year = {2025}
}