零样本目标计数的量化与空间感知提升:QICA 框架
计算机视觉与模式识别
2026-03-18 v1
摘要
零样本目标计数(ZSOC)旨在无需视觉示例地枚举任意类别目标,但现有方法常将计数视为粗糙的检索任务,缺乏细粒度的量化感知。此外,由于在模型适应期间引起特征空间扭曲,常表现出空间不敏感和泛化性能下降。为此,我们提出 QICA 框架,融合量化感知与鲁棒的空间聚合。具体而言,我们引入协同提示策略(SPS),通过数值条件化提示适配视觉和语言编码器,弥合语义识别与量化推理之间的鸿沟。为缓解特征扭曲,我们提出成本聚合解码器(CAD),其直接作用于视觉-文本相似度图上。通过空间聚合细化这些图,CAD 可防止过拟合,同时保持零样本迁移能力。此外,采用多级量化对齐损失()以强制整个流程中的数值一致性。大量实验表明,在 FSC-147 数据集上实现优异表现,零样本评估在 CARPK 和 ShanghaiTech-A 上验证了对未知领域的卓越泛化能力。
引用
@article{arxiv.2603.16129,
title = {Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting},
author = {Da Zhang and Bingyu Li and Feiyu Wang and Zhiyuan Zhao and Junyu Gao},
journal= {arXiv preprint arXiv:2603.16129},
year = {2026}
}
备注
Accepted to CVPR 2026