通过视频改进基于标记的对象检测
计算机视觉与模式识别
2025-08-21 v2
摘要
本文改进了 Pix2Seq 对象检测器,通过扩展至视频实现了提升。过程中引入了一种新的端到端视频对象检测方式,相较于现有视频检测器在两个关键方面取得改进。首先,通过将对象表示为离散标记的可变长度序列,我们能够简洁地表示广泛变化的视频对象数量,涵盖多样形状和位置,无需引入任何局化线索作为训练过程。这消除了对常规检测器受限的可能框空间进行采样的需求,从而解决训练时稀疏损失和推理时基于启发式的后处理两个问题。其次,将视频对象概念化为完全集成且不可分割的三维框或轨迹,而非生成图像特定的二维框并通过链接这些框来构建视频对象,这是大多数常规检测器的做法。这使得其能够轻松地随可用计算资源的增加,通过简单地增加网络输入的视频子序列长度来实现扩展,甚至可以泛化到整个视频上的多目标跟踪。我们在多个数据集上与基线 Pix2Seq 静态检测器进行比较,展示了持续的改进,尽管受限于计算资源仍显示出强烈的瓶颈。我们还在 UA-DETRAC 上与几个视频检测器进行比较,表明即使在计算瓶颈下也能与当前最先进的方法相抗衡。我们将代码和模型公开 disponible。
引用
@article{arxiv.2506.22562,
title = {Improving Token-based Object Detection with Video},
author = {Abhineet Singh and Nilanjan Ray},
journal= {arXiv preprint arXiv:2506.22562},
year = {2025}
}
备注
Published in IEEE Access