中文

TokenCLIP:面向零样本异常检测的字符级提示学习

计算机视觉与模式识别 2026-03-02 v4

摘要

将 CLIP 应用于对未见对象进行异常检测已展现出零样本的强大潜力。然而,现有方法通常依赖单一的文本空间来对齐视觉语义,以适应不同对象和领域之间的差异。这种单一的对齐方式阻碍了模型准确捕捉多样化异常语义。我们提出了 TokenCLIP,一种基于字符级适应框架,使视觉空间与可学习文本空间之间实现动态对齐,以实现细粒度异常学习。与将所有视觉字符映射到单一、字符无关的文本空间不同,TokenCLIP 将每个字符对齐到表示其视觉特征的定制化文本子空间。直接为每个字符显式分配唯一的可学习文本空间在计算上不可行且容易优化不足。我们采用一组正交子空间代替字符无关的文本空间,然后通过语义亲和力引导动态分配每个字符到子空间组合中,这既支持定制化又高效地实现了字符级适应。为此,我们将动态对齐建模为最优传输问题,所有视觉字符基于语义相似性被输送到文本子空间。OT 的传输约束确保子空间间优化充分,并鼓励它们关注不同的语义。求解后,可获得一种自适应分配每个字符到语义相关子空间的输送方案。随后应用 top-k 掩码稀疏化该方案,使子空间针对不同视觉区域进行专业化。大量实验表明,TokenCLIP 的优越性得以体现。

关键词

引用

@article{arxiv.2510.21171,
  title  = {TokenCLIP: Token-wise Prompt Learning for Zero-shot Anomaly Detection},
  author = {Qihang Zhou and Binbin Gao and Guansong Pang and Xin Wang and Jiming Chen and Shibo He},
  journal= {arXiv preprint arXiv:2510.21171},
  year   = {2026}
}