中文

视频抠图的训练后量化

计算机视觉与模式识别 2025-06-13 v1 人工智能

摘要

视频抠图对于电影制作和虚拟现实等应用至关重要,然而在资源受限设备上部署其计算密集的模型面临挑战。量化是模型压缩与加速的关键技术。作为一种高效方法,训练后量化(PTQ)对于视频抠图仍处于起步阶段,在保持准确性和时间一致性方面面临重大挑战。为应对这些挑战,本文提出了一种专门针对视频抠图模型的新型通用PTQ框架,据我们所知,这是该领域的首次系统性尝试。我们的贡献包括:(1) 一种两阶段PTQ策略,结合基于块重构的优化以实现快速稳定的初始量化和局部依赖捕获,随后进行量化参数的全局校准以最小化精度损失。(2) 一种统计驱动的全局仿射校准(GAC)方法,使网络能够补偿由忽略BN层效应等因素引起的累积统计偏差,甚至将现有PTQ方法在视频抠图任务上的误差降低多达20%。(3) 一种光流辅助(OFA)组件,利用帧的时间先验和语义先验来引导PTQ过程,增强模型在复杂场景中区分运动前景的能力,最终在超低位量化下实现接近全精度的性能。全面的定量和视觉结果表明,我们的PTQ4VM在不同位宽下相比现有量化方法达到了最先进的精度性能。我们指出,4位PTQ4VM甚至实现了接近全精度对应模型的性能,同时节省8倍FLOP。

关键词

引用

@article{arxiv.2506.10840,
  title  = {Post-Training Quantization for Video Matting},
  author = {Tianrui Zhu and Houyuan Chen and Ruihao Gong and Michele Magno and Haotong Qin and Kai Zhang},
  journal= {arXiv preprint arXiv:2506.10840},
  year   = {2025}
}