GISE-TTT:用于全局信息分割与增强的框架
计算机视觉与模式识别
2025-09-16 v3
摘要
本文针对视频对象分割(VOS)中捕捉长视频序列全局时序依赖性的挑战进行了研究。现有架构常无法有效建模跨扩展时间范围的依赖性。为克服这一限制,我们引入了 GISE-TTT,这是一种新型架构,通过协同设计的分层方法将 Temporal Transformer (TTT) 层集成到基于转换器的框架中。TTT 层系统性地将历史时序信息压缩编码为隐藏状态,以生成全局一致的上下文表示。通过层次化拼接实现的多阶段上下文聚合,框架在网络各层逐步细化时空依赖关系。该设计首次系统性实证表明,在视频分割任务中,将全局信息分布在多个网络层中对于充分利用依赖关系至关重要。消融实验表明,在高层特征阶段集成 TTT 模块显著提升了全局建模能力,从而增强了网络捕捉长程时序关系的能力。在 DAVIS 2017 数据集上的大量实验表明,GISE-TTT 相对于基线模型在分割精度上提升了 3.2%,为通过网络架构策略化利用全局信息提供了全面证据。代码将发布于:https://github.com/uuool/GISE-TTT。
引用
@article{arxiv.2504.00879,
title = {GISE-TTT:A Framework for Global InformationSegmentation and Enhancement},
author = {Fenglei Hao and Yuliang Yang and Ruiyuan Su and Zhengran Zhao and Yukun Qiao and Mengyu Zhu},
journal= {arXiv preprint arXiv:2504.00879},
year = {2025}
}
备注
The manuscript requires further improvement