基于过滤机制的少样本视频对象检测的时间感知视觉Transformer
计算机视觉与模式识别
2025-11-19 v1 人工智能
摘要
少样本视频对象检测(FSVOD)旨在解决在有限标注样本的情况下检测视频中的新颖对象这一挑战,克服了传统检测方法需要大量训练数据的限制。这一任务面临着关键挑战,包括在遮挡和外观变化影响的帧之间保持时间一致性,以及在不依赖复杂区域提议的情况下实现新颖对象的泛化——后者往往计算昂贵且需要特定任务的训练。我们提出的新颖对象感知的时间建模方法通过纳入一种过滤机制,选择性地在帧之间传递高置信度对象特征,从而解决了这些挑战。这使我们能够实现高效的特征传递,减少噪声积累,并在少样本设置下提高检测准确度。通过利用在少样本训练中获得的检测和分类头部,实现了以聚焦的特征传递为导向的鲁�棒时间一致性,而无需依赖显式的对象管道提议。我们的做法在性能上取得了提升,5-shot 设置下的 AP 分别提高了 3.7%(FSVOD-500)、5.3%(FSYTV-40)、4.3%(VidOR)和 4.5(VidVRD)。进一步的结果显示,在 1-shot、3-shot 和 10-shot 配置下也均取得了改进。我们将代码公开于:https://github.com/yogesh-iitj/fs-video-vit。
引用
@article{arxiv.2511.13784,
title = {Temporal Object-Aware Vision Transformer for Few-Shot Video Object Detection},
author = {Yogesh Kumar and Anand Mishra},
journal= {arXiv preprint arXiv:2511.13784},
year = {2025}
}
备注
Accepted at AAAI 2026 Main Track