中文

CR-QAT:面向开放词汇目标检测的课程化关系量化感知训练

计算机视觉与模式识别 2026-03-10 v2

摘要

开放词汇目标检测(Open-Vocabulary Object Detection, OVOD)通过视觉-语言对齐实现新类别检测,但巨大的模型规模阻碍了在资源受限设备上的部署。虽然量化提供了实用的压缩方案,但我们发现,极低位(如 4 位)的量化严重损害细粒度视觉-语言对齐,并扭曲区域间关系结构。为此,我们提出课程化关系量化感知训练(CR-QAT),一种集成阶段性优化与关系知识蒸馏的框架。在 CR-QAT 中,课程化 QAT(CQAT)通过分阶段量化模型来缓解误差累积,确保通过误差隔离实现稳定优化。同时,应用文本导向的关系蒸馏(TRKD)于任务相关模块。通过构建以文本为锚点的两两相似度矩阵,TRKD 全面传递教师的多维关系知识。实验在 LVIS 和 COCO 零样本基准上表明,CR-QAT 在激进的低位设置下 consistently 优于现有 QAT 基线,分别实现了最高 38.9% 和 40.9% 的相对 AP 提升。

关键词

引用

@article{arxiv.2603.05964,
  title  = {CR-QAT: Curriculum Relational Quantization-Aware Training for Open-Vocabulary Object Detection},
  author = {Jinyeong Park and Donghwa Kang and Brent ByungHoon Kang and Hyeongboo Baek and Jibum Kim},
  journal= {arXiv preprint arXiv:2603.05964},
  year   = {2026}
}