中文

基于条件受控扩散的超低比特率视频压缩主动采样

计算机视觉与模式识别 2026-05-05 v1

摘要

扩散模型为感知重建提供了强大的生成先验,但有效的视频压缩需要使用高度紧凑的条件信号来控制生成过程。在本工作中,我们提出了 ActDiff-VC,一个面向超低比特率视频压缩的扩散-based 框架。我们的方法将视频划分为可变长度的片段,仅在需要时传输关键帧,并使用一组紧凑的跟踪点轨迹总结时间动态。条件于这些稀疏信号,条件扩散解码器合成剩余帧,实现在严苛的比特率约束下的感知上真实的重构。为支持此设计,我们引入了两种机制:内容自适应关键帧选择和预算感知的稀疏轨迹选择,这两者共同 enable 为生成重构提供紧凑而有效的条件。在 UVG 和 MCL-JCV 基准测试上实验表明,ActDiff-VC 在匹配 NIQE 时实现最高可达 64.6% 的比特率降低,较强的学习型编解码器在相同比特率下将 KID 提升最高 64.6%,FID 提升最高 37.7%,并在超低比特率范围内提供有利的感知率-失真权衡。

关键词

引用

@article{arxiv.2605.02849,
  title  = {Active Sampling for Ultra-Low-Bit-Rate Video Compression via Conditional Controlled Diffusion},
  author = {Amirhosein Javadi and Shirin Saeedi Bidokhti and Tara Javidi},
  journal= {arXiv preprint arXiv:2605.02849},
  year   = {2026}
}

备注

21 pages, 11 figures, 3 tables