中文

CountFormer:基于Transformer学习类无范例目标计数中的视觉重复与结构

计算机视觉与模式识别 2026-03-10 v2 人工智能

摘要

人类往往可以通过观察视觉重复性和构成来计数陌生对象,而不仅仅依赖对象类别。然而,许多无范例计数模型在此类情境下难以应对,可能对包含对称组件、重复子结构或部分遮挡的对象进行过度计数。我们引入CountFormer,这是一种受CounTR启发的密度回归框架的受控改编版本,其中用自监督视觉基础模型DINOv2替换图像编码器。 resulting transformer features与显式的二维位置嵌入结合,通过轻量级卷积网络解码以产生密度图,其积分给出最终计数。我们的目标不是提出新的计数架构,而是研究基础表征在严格无范例设置下是否提高结构一致性。在FSC-147数据集上,CountFormer在官方基准测试中实现了竞争性能(MAE 19.06,RMSE 118.45)。定性分析表明,对于某些结构复杂的对象,CountFormer发生了较少的部件级过度计数错误,而整体误差与先前方法基本一致。敏感性分析显示,评估指标strongly受少数极端高密度场景的影响。总体而言,结果凸显了表征质量在无范例目标计数中的作用。

关键词

引用

@article{arxiv.2510.23785,
  title  = {CountFormer: A Transformer Framework for Learning Visual Repetition and Structure in Class-Agnostic Object Counting},
  author = {Md Tanvir Hossain and Akif Islam and Mohd Ruhul Ameen},
  journal= {arXiv preprint arXiv:2510.23785},
  year   = {2026}
}

备注

Accepted at the 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence and Networking (QPAIN 2026)