面向开放词汇目标检测的文本反演:无需遗忘的高效适应方法
计算机视觉与模式识别
2025-08-08 v1
摘要
近期大型预训练视觉语言模型(VLM)在多个目标检测基准上取得了最前沿性能,同时展现出强大的零样能力,但要实现特定目标的最佳性能,仍需进行某种形式的微调。虽然初始VLM权重允许进行出色的少样迁移学习,但通常会导致原始自然语言查询和零样能力的丢失。灵感来源于文本反演(Tiling)在个人化文本到图像扩散模型中的成功,我们提出了类似的表述用于开放词汇目标检测。Tiling允许通过学习新的或改进现有标记的方式,从仅三个样本就准确检测新颖或细粒度目标。所学标记完全与原始VLM权重兼容,同时保持其冻结,保留原始模型的基准性能,并利用其现有能力,如零样域迁移(例如,仅在真实照片上训练后检测草图中对象的检测)。存储和梯度计算仅限于标记嵌入维度,计算需求显著低于全模型微调。我们评估了该方法是否匹配或超越了因遗忘而受监督DL重建方法的基线方法,在广泛的定量和定性实验中进行了验证。
引用
@article{arxiv.2508.05323,
title = {Textual Inversion for Efficient Adaptation of Open-Vocabulary Object Detectors Without Forgetting},
author = {Frank Ruis and Gertjan Burghouts and Hugo Kuijf},
journal= {arXiv preprint arXiv:2508.05323},
year = {2025}
}