中文

COAL:面向判别式指代多目标跟踪的反事实与观测增强对齐学习

计算机视觉与模式识别 2026-05-15 v1

摘要

指代多目标跟踪 (RMOT) 面临着高判别性需求与稀疏语义监督之间的根本结构矛盾。这种不匹配在需要对复杂组合语义进行细粒度判别的高度同质场景中尤为突出。然而,在稀疏监督下,模型会过拟合于显著但不充分的线索,从而助长捷径学习与语义坍缩。为解决此问题,我们提出了 COAL(反事实与观测增强对齐学习),这是一个通过知识正则化将 RMOT 推进至超越孤立结构优化的框架。首先,我们通过 VLM 引入显式语义注入 (ESI),以稠密化观测空间并增强实例判别性。其次,借助 LLM 推理,我们提出反事实学习 (CFL) 来增强监督,强制执行严格的属性验证以实现稳健的组合识别。这些策略统一在分层多流集成 (HMSI) 架构中,该架构将外部知识蒸馏为特定领域的判别性表示。在 Refer-KITTI 和 Refer-KITTI-V2 基准上的实验验证了 COAL 的有效性。值得注意的是,它在极具挑战性的 Refer-KITTI-V2 上以 7.28% 的 HOTA 超越了现有最先进水平。这些结果证明了知识正则化在解决 RMOT 中稀疏性-判别性悖论方面的有效性。

关键词

引用

@article{arxiv.2605.14795,
  title  = {COAL: Counterfactual and Observation-Enhanced Alignment Learning for Discriminative Referring Multi-Object Tracking},
  author = {Shukun Jia and Shiyu Hu and Yipei Wang and Ximeng Cheng and Yichao Cao and Xiaobo Lu},
  journal= {arXiv preprint arXiv:2605.14795},
  year   = {2026}
}