在任意模态中跟踪与分割任意对象
计算机视觉与模式识别
2025-11-26 v1 人工智能
多媒体
摘要
跟踪与分割在视频理解中扮演着至关重要的角色,为视频序列中的对象提供基本的位置信息和时间关联。尽管具有共同的目标,现有方法通常使用专门的架构或模态特定的参数来处理这些任务,这限制了其泛化能力和可扩展性。最近的研究尝试从任意模态输入或多任务推理的角度统一多种跟踪和分割子任务。然而,这些方法往往忽视了两种关键挑战:不同模态之间的分布差距和任务之间的特征表示差距。这些问题阻碍了有效的跨任务和跨模态知识共享,最终制约了真正通用模型的发展。为了解决这些局限性,我们提出了一个名为SATA的通用跟踪与分割框架,统一了广泛的跟踪和分割子任务以及任意模态输入。具体而言,我们提出了一种解耦混合专家(DeMoE)机制,将统一的表示学习任务解耦为跨模态共享知识和特定信息的建模过程,从而使模型在保持灵活性的同时增强泛化能力。此外,我们引入了一种任务感知多目标跟踪(TaMOT)流水线,将所有任务输出统一为一组具有校准ID信息的实例,从而减轻多任务训练期间任务特定知识的退化。SATA在18个具有挑战性的跟踪与分割基准测试上展示了优越的性能,为更具泛化性的视频理解提供了新的视角。
引用
@article{arxiv.2511.19475,
title = {Tracking and Segmenting Anything in Any Modality},
author = {Tianlu Zhang and Qiang Zhang and Guiguang Ding and Jungong Han},
journal= {arXiv preprint arXiv:2511.19475},
year = {2025}
}
备注
Accpetd by AAAI 2026