AuxAdapt:用于时间一致视频语义分割的稳定高效测试时自适应
计算机视觉与模式识别
2021-10-26 v1 人工智能
机器学习
多媒体
摘要
在视频分割中,跨帧生成时间一致的结果与实现逐帧精度同等重要。现有方法依赖光流正则化或用测试数据微调以获得时间一致性。然而,光流并非总可用且可靠,且计算代价高昂;测试时微调原模型对成本敏感。本文提出一种高效、直观且无监督的在线自适应方法 AuxAdapt,用于提升多数神经网络模型的时间一致性。它不需光流且仅需对视频单次遍历。由于不一致性主要源于模型输出的不确定性,我们提出一种自适应机制:模型在流式处理视频时从其自身分割决策中学习,从而对跨帧相似像素产生更自信且时间一致的标注。为稳定与高效,我们利用一个小型辅助分割网络(AuxNet)协助该自适应。具体而言,AuxNet 通过将自身估计加到主分割网络(MainNet)的估计上来重调其决策。在每一帧,仅 AuxNet 经反向传播更新,而 MainNet 保持固定。我们在标准视频基准(包括 Cityscapes、CamVid 与 KITTI)上广泛评估了该测试时自适应方法。结果表明,相较最先进测试时自适应方法,我们的方法提供了标签级准确、时间一致且计算高效的适应(开销降低 5 倍以上)。
引用
@article{arxiv.2110.12369,
title = {AuxAdapt: Stable and Efficient Test-Time Adaptation for Temporally Consistent Video Semantic Segmentation},
author = {Yizhe Zhang and Shubhankar Borse and Hong Cai and Fatih Porikli},
journal= {arXiv preprint arXiv:2110.12369},
year = {2021}
}
备注
To appear in WACV 2022; Comments and questions are welcome;