中文

Time2General:用于域通用视频语义分割的时空不变表示学习

计算机视觉与模式识别 2026-02-24 v2

摘要

域通用视频语义分割(DGVSS)在单一标记驾驶域上进行训练,直接部署到未知域且无需目标标签和测试时适应,同时保持视频流中一致的时序预测。在实际应用中,域迁移和时序抽样偏移会破坏基于对应关系的传播和固定步长时序聚合,导致在标记稳定区域出现严重的帧间闪烁。我们提出Time2General,一个基于稳定查询(Stability Queries)构建的DGVSS框架。Time2General引入时空记忆解码器,将多帧上下文聚合到 clip 级别的时空记忆中,并在不进行显式对应传播的情况下解码出一致的逐帧掩码。为进一步抑制闪烁并提高对不同抽样率的鲁棒性,提出了掩码时序一致性损失(Masked Temporal Consistency Loss),用于正规化不同步长下的时序预测差异,并随机化训练步长以暴露模型于各种时序间隙。大量实验表明,Time2General 在多个驾驶基准数据集上实现了在跨域准确率和时序稳定性方面相较于先前的DGSS和VSS基线获得了实质性的提升,同时以最高可达 18 FPS 的速度运行。代码将在审稿期间公开。

关键词

引用

@article{arxiv.2602.09648,
  title  = {Time2General: Learning Spatiotemporal Invariant Representations for Domain-Generalization Video Semantic Segmentation},
  author = {Siyu Chen and Ting Han and Haoling Huang and Chaolei Wang and Chengzheng Fu and Duxin Zhu and Guorong Cai and Jinhe Su},
  journal= {arXiv preprint arXiv:2602.09648},
  year   = {2026}
}