从静态到动态:基于潜在转换先验的物理感知图像编辑
计算机视觉与模式识别
2026-03-02 v2
摘要
基于指令的图像编辑在语义对齐方面取得了显著的成功,但最先进的模型在涉及复杂因果动态(如折射或材料变形)的编辑中经常无法生成物理上合理的结果。我们将这一限制归因于将编辑视为图像对之间的离散映射的主导范式,这仅提供边界条件,使得转换动态未被充分指定。为此,我们将物理感知编辑重新表述为预测物理状态转换,并引入 PhysicTran38K——一个大型视频基数据集,包含 38K 条跨越五个物理领域的转换轨迹,通过两阶段筛选和约束感知标注管道构建。基于此监督,我们提出了 PhysicEdit——一个端到端框架,配备文本-视觉双思考机制。它结合了冻结的 Qwen2.5-VL 进行物理依存推理,以及可学习的转换查询,为扩散主干网络提供时序自适应视觉指导。实验表明,PhysicEdit 在物理真实性上超过 Qwen-Image-Edit 提升了 5.9%,在知识依存编辑方面提升了 10.1%,在开源方法上实现了新的技术水平,而且与领先的专有模型保持有竞争力。
引用
@article{arxiv.2602.21778,
title = {From Statics to Dynamics: Physics-Aware Image Editing with Latent Transition Priors},
author = {Liangbing Zhao and Le Zhuo and Sayak Paul and Hongsheng Li and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2602.21778},
year = {2026}
}
备注
All code, checkpoints, and datasets are available at https://liangbingzhao.github.io/statics2dynamics/