面向视频增强的渐进式多帧量化方法(PMQ-VE)
计算机视觉与模式识别
2025-05-27 v2
摘要
多帧视频增强任务旨在利用来自多个帧的时序信息来提升视频序列的空间和时间分辨率及质量,这在流媒体视频处理、监视和生成中广泛应用。虽然诸多基于 Transformer 的增强方法取得了令人印象的性能,但其计算和内存需求阻碍了在边缘设备上的部署。量化通过降低权重和激活的位宽来提高效率,提供了实用的解决方案。然而,直接将现有的量化方法应用于视频增强任务常常导致显著的性能下降和细节丢失。这源于两个局限性:(a) 无法在帧之间分配不同的表示容量,导致动态范围适应次优;(b) 过度依赖全精度教师模型,限制了低位学生模型的学习。为克服上述挑战,我们提出一种新颖的视频增强量化方法:渐进式多帧量化用于视频增强(PMQ-VE)。该框架具有粗到细的两阶段过程:基于回溯的多帧量化(BMFQ)和渐进式多教师蒸馏(PMTD)。BMFQ 采用分位百分比初始化和结合修剪和回溯的迭代搜索,以实现稳健的裁剪边界。PMTD 采用渐进式蒸馏策略,同时利用全精度和多个高位(INT)教师,以增强低位模型的容量和质量。广泛的实验表明,我们的方法在多个任务和基准上超越了现有方法,实现了最先进的性能。代码将在 https://github.com/xiaoBIGfeng/PMQ-VE 上公开。
引用
@article{arxiv.2505.12266,
title = {PMQ-VE: Progressive Multi-Frame Quantization for Video Enhancement},
author = {ZhanFeng Feng and Long Peng and Xin Di and Yong Guo and Wenbo Li and Yulun Zhang and Renjing Pei and Yang Wang and Yang Cao and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2505.12266},
year = {2025}
}