面向端到端多目标跟踪的片段级不确定性与时间感知主动学习
计算机视觉与模式识别
2026-05-12 v1
摘要
动态环境中的多目标跟踪(MOT)依赖鲁棒的时间推理来随时间维持一致的物体身份。基于 Transformer 的端到端 MOT 模型通过显式建模时间依赖性实现了强大的性能,然而训练它们需要大量的边界框和身份标注。鉴于视频中高昂的标注成本和强烈的冗余性,主动学习(AL)是提高标注效率的有效方法。然而,现有的 MOT 主动学习方法主要在帧级别运行,这与现代端到端跟踪器的推理和训练依赖多帧片段的结构不匹配。为了弥合这一差距,我们提出了片段级主动学习公式,并提出了片段级不确定性与时间感知主动学习(CUTAL)。与基于帧的方法不同,CUTAL 利用从多帧预测导出的不确定性指标对每个片段进行评分,以捕捉帧间对应关系的歧义性,同时强制时间多样性以选择信息丰富且非冗余的子集。实验表明,在相同的标签预算下,CUTAL 在 MeMOTR 和 SambaMOTR 上均取得了比基线更强的整体性能。值得注意的是,在两个数据集上,CUTAL 仅使用 50% 的标注训练数据,便在 MeMOTR 上取得了与全监督相当的性能。
引用
@article{arxiv.2605.09858,
title = {Clip-level Uncertainty and Temporal-aware Active Learning for End-to-End Multi-Object Tracking},
author = {Riku Inoue and Shogo Sato and Kazuhiko Murasaki and Tomoyasu Shimada and Toshihiko Nishimura and Ryuichi Tanida},
journal= {arXiv preprint arXiv:2605.09858},
year = {2026}
}
备注
Accepted to 2026 IEEE International Conference on Image Processing (ICIP). Copyright 2026 IEEE. Published in 2026 IEEE International Conference on Image Processing (ICIP), scheduled for 13-17 September 2026 in Tampere, Finland