GOT-Edit:基于在线模型编辑的几何感知通用目标跟踪
计算机视觉与模式识别
2026-02-25 v3 人工智能
机器学习
多媒体
图像与视频处理
摘要
人类对有效目标跟踪的感知源于隐式使用先验三维知识和语义推理。相比之下,大多数通用目标跟踪(GOT)方法主要依赖目标及其周围环境的二维特征,忽略了三维几何线索,导致其对部分遮挡、干扰项以及几何和外观变化极其敏感。为解决这一局限性,我们提出了 GOT-Edit,一种集成几何感知线索的在线跨模态模型编辑方法,从二维视频流中集成几何信息。我们的方法利用预训练的视觉几何 grounding Transformer 的特征,仅通过少量二维图像即可推断几何线索。为解决几何与语义无缝融合的挑战,GOT-Edit 执行在线模型编辑。通过在模型更新期间利用零空间约束,它在保持语义判别力的同时纳入几何信息,在多种场景下均实现持续的更好性能。广泛的实验在多个 GOT 基准数据集上表明,GOT-Edit 在遮挡和杂乱条件下实现了卓越的鲁棒性和准确性,确立了将二维语义与三维几何推理结合用于通用目标跟踪的新范式。项目页面可在 https://chenshihfang.github.io/GOT-EDIT 查看。
引用
@article{arxiv.2602.08550,
title = {GOT-Edit: Geometry-Aware Generic Object Tracking via Online Model Editing},
author = {Shih-Fang Chen and Jun-Cheng Chen and I-Hong Jhuo and Yen-Yu Lin},
journal= {arXiv preprint arXiv:2602.08550},
year = {2026}
}
备注
ICLR 2026