中文

基于蒸馏辅助测试时适应的视频语义分割模型自启动

计算机视觉与模式识别 2026-04-15 v2

摘要

完全监督的视频语义分割(VSS)高度依赖密集标注的视频数据,限制了实际应用的可行性。或者对预训练的图像语义分割(ISS)模型逐帧应用,可避免标注成本,但忽略了关键的时间一致性。最近的基础模型如 SAM2 能够实现高质量的掩码传递,但由于语义理解有限和计算开销大,难以直接用于 VSS。本文提出了 DiTTA(Distillation-assisted Test-Time Adaptation),一种 novel 框架,通过高效测试时适应(TTA)将 ISS 模型转换为具有时序 awareness 的 VSS 模型,且无需标注视频。DiTTA 在简短的单遍初始化阶段将 SAM2 的时序分割知识蒸馏到 ISS 模型中,并辅以轻量级时序融合模块以整合跨帧上下文。关键在于,即使仅适应高度有限的局部视频片段(例如初始 10%),DiTTA 也能实现稳健的泛化,显著优于在推理期间反复调用 SAM2 的零样态细化方法。大量实验在 VSPW 和 Cityscapes 上表明,DiTTA 的有效性,性能与 fully-supervised VSS 方法持久或更优,从而为实际场景中的 VSS 任务提供了一种实用且无需标注的解决方案。

关键词

引用

@article{arxiv.2604.10950,
  title  = {Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation},
  author = {Jihun Kim and Hoyong Kwon and Hyeokjun Kweon and Kuk-Jin Yoon},
  journal= {arXiv preprint arXiv:2604.10950},
  year   = {2026}
}

备注

accepted at CVPR 2026