中文

用于小数据集密集预测的冻结视觉Transformer:箭靶定位案例研究

计算机视觉与模式识别 2026-04-21 v1 人工智能 机器学习

摘要

我们提出了一个用于自动检测、定位和评分40厘米室内射箭靶面上箭孔的系统,仅使用48张带标注的照片(5084个箭孔)进行训练。我们的流程结合了三个组件:一个基于颜色的规范校正阶段,将透视畸变的照片映射到标准化坐标系,其中像素距离对应已知的物理测量值;一个冻结的自监督视觉Transformer(DINOv3 ViT-L/16)与AnyUp引导特征上采样配对,以从32×32的图块令牌恢复亚毫米空间精度;以及轻量级的CenterNet风格检测头用于箭心热图预测。在总共3.08亿个参数中,仅有380万个是可训练的。在三个交叉验证折上,我们实现了平均F1分数0.893±0.011和平均定位误差1.41±0.06毫米,与需要更多训练数据的先前全监督方法相当或更好。消融研究表明,通常对亚像素细化至关重要的CenterNet偏移回归头,在我们的设置中提供了可忽略的检测改进,同时降低了定位精度。这表明引导特征上采样已经解决了通过图块令牌化丢失的空间精度。在下游射箭指标上,该系统恢复了每张图像的平均箭矢分数,中位误差为1.8%,组质心位置的中位误差为4.00毫米。这些结果表明,具有最小任务特定适应的冻结基础模型为小数据场景下的密集预测提供了一种实用范式。

关键词

引用

@article{arxiv.2604.16758,
  title  = {Frozen Vision Transformers for Dense Prediction on Small Datasets: A Case Study in Arrow Localization},
  author = {Maxwell Shepherd},
  journal= {arXiv preprint arXiv:2604.16758},
  year   = {2026}
}