中文

基于潜在对齐的对数编码 HDR 视频生成

计算机视觉与模式识别 2026-04-14 v1

摘要

高动态范围 (HDR) 图像能够忠实地代表场景辐射,但由于其与生成模型所依赖的有界、感知压缩数据之间的不匹配,仍然具有较大挑战性。自然的解决方案是学习新的 HDR 表示,这会引入额外的复杂性和数据需求。本文表明,实际可以通过利用现成生成模型已捕获的强大视觉先验来实现 HDR 生成。我们观察到,广泛用于电影制作管道的对数编码将 HDR 图像映射到与这些模型潜在空间天然对齐的分布中,从而通过轻量级微调即可实现直接适配,而无需重新训练编码器。为恢复输入中不可直接观察到的细节,我们进一步引入一种基于相机模拟退化的训练策略,以鼓励模型从其学习的先验中推断缺失的高动态范围内容。结合这些见解,我们使用经过最小适配的预训练视频模型实现了高质量的 HDR 视频生成,在多样化场景和具有挑战性光照条件下均取得优异效果。我们的结果表明,尽管 HDR 代表了根本不同图像形成范式,但只要表示方式与其学习的先验对齐,就无需重新设计生成模型即可有效处理。

关键词

引用

@article{arxiv.2604.11788,
  title  = {HDR Video Generation via Latent Alignment with Logarithmic Encoding},
  author = {Naomi Ken Korem and Mohamed Oumoumad and Harel Cain and Matan Ben Yosef and Urska Jelercic and Ofir Bibi and Yaron Inger and Or Patashnik and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2604.11788},
  year   = {2026}
}

备注

https://HDR-LumiVid.github.io