更强的语义编码器会损害 relighting 性能:通过增强潜在内在属性探测视觉先验
计算机视觉与模式识别
2026-02-03 v1
摘要
图像到图像 relighting 需要能将场景属性与光照解耦的表示。近期方法依赖潜在内在表示,但受限于约束条件,常在金属和玻璃等挑战性材料上失败。自然的假设是更强的预训练视觉先验应能解决这些问题。我们发现相反:来自顶尖语义编码器的特征常会降低 relighting 质量,揭示了语义抽象与光度保真度之间的根本性权衡。我们研究这一权衡,提出增强潜在内在属性(ALI),通过将像素对齐的视觉编码器特征融合到潜在内在框架中,同时引入自监督细化策略以缓解真实世界配对数据稀缺问题。在仅使用无标签真实世界图像对进行训练并搭载密集像素对齐视觉先验的情况下,ALI 在 relighting 中实现了显著提升,尤其在复杂镜面材料上取得最大 gains。项目页面:https:\augmented-latent-intrinsics.github.io
关键词
引用
@article{arxiv.2602.01391,
title = {Stronger Semantic Encoders Can Harm Relighting Performance: Probing Visual Priors via Augmented Latent Intrinsics},
author = {Xiaoyan Xing and Xiao Zhang and Sezer Karaoglu and Theo Gevers and Anand Bhattad},
journal= {arXiv preprint arXiv:2602.01391},
year = {2026}
}
备注
Project page: https:\\augmented-latent-intrinsics.github.io