中文

基于时间的聚类分配:高效实时视频分割

计算机视觉与模式识别 2025-08-11 v1

摘要

Vision Transformer 在图像和视频领域的分割模型能力方面取得了显著进展。其中,Swin Transformer 以其捕获层次化、多尺度表示的能力,在视频分割中广受欢迎作为 backbone。然而,尽管其窗口注意力方案在大型变体(常用于视频中密集预测)时仍会带来高计算成本,这是实时、资源受限应用的主要瓶颈。虽然已提出 token 降低方法来缓解此问题,但 Swin 的基于窗口的注意力机制需要每个窗口固定数量的 token,限制了常规剪枝技术的适用性。同时,训练-free token 聚类方法在图像分割中展现出希望,同时保持窗口一致性。然而,它们未充分利用时间冗余,错失了进一步优化视频分割性能的关键机会。我们引入 Temporal Cluster Assignment (TCA),一种轻量且有效的、无需微调的策略,通过利用跨帧的时间一致性来增强 token 聚类。不同于无差别丢弃冗余 token,TCA 通过时间相关性细化 token 聚类,从而在显著降低计算成本的同时保留细粒度细节。对 YouTube-VIS 2019、YouTube-VIS 2021、OVIS 和一个私人外科视频数据集上的大规模评估表明,TCA 持续提升了基于聚类方法的准确性-速度权衡。我们的结果表明,TCA 在自然视频和领域特定视频方面都能有效泛化。

关键词

引用

@article{arxiv.2508.05851,
  title  = {Temporal Cluster Assignment for Efficient Real-Time Video Segmentation},
  author = {Ka-Wai Yung and Felix J. S. Bragman and Jialang Xu and Imanol Luengo and Danail Stoyanov and Evangelos B. Mazomenos},
  journal= {arXiv preprint arXiv:2508.05851},
  year   = {2025}
}