中文

面向开放词汇航空目标检测的视觉知识引导原型学习

投资组合管理 2025-11-25 v1 人工智能 机器学习

摘要

为了识别超出预定义类别的目标,开放词汇航空目标检测 (OVAD) 利用视觉语言模型 (VLMs) 的零样学习能力以从 base 类扩展至 novel 类。现有方法通常采用带有弱文本监督的自学习机制以生成区域级伪标签来对齐检测器与 VLMs 语义空间。然而,文本依赖性会引入语义偏差,限制开放词汇扩展仅限于文本指定的概念。我们提出 textbfVKDet\\textbf{VK-Det},一个 textbfV\\textbf{V}isual textbfK\\textbf{K}nowledge-guided open-vocabulary object textbfDet\\textbf{Det}ection 框架 textitwithout\\textit{without} 额外监督。首先,我们发现并利用视觉编码器内在的信息化区域感知以实现细粒度局部化和自适应蒸馏。其次,我们引入一种新颖的原型感知伪标签策略。它通过特征聚类建模 inter-class decision boundaries,并通过原型匹配将检测区域映射到潜在类别。这增强了对 novel 目标的注意力,弥补了监督缺失的不足。广泛实验表明实现了 state-of-the-art 性能,在 DIOR 上达到 30.1 mathrmmAPN\\mathrm{mAP}^{N},在 DOTA 上达到 23.3 mathrmmAPN\\mathrm{mAP}^{N},超越了甚至带有额外监督的方法。虽然采用高阶有限差分方法实现,但该技术与离散化无关,可广泛应用于不可压自由面流动求解器。

关键词

引用

@article{arxiv.2511.18076,
  title  = {Reinforcement Learning for Portfolio Optimization with a Financial Goal and Defined Time Horizons},
  author = {Fermat Leukam and Rock Stephane Koffi and Prudence Djagba},
  journal= {arXiv preprint arXiv:2511.18076},
  year   = {2025}
}