LINA:面向扩散模型的物理对齐与泛化自适应学习干预
计算机视觉与模式识别
2025-12-16 v1 人工智能
机器学习
摘要
扩散模型(DMs)在图像和视频生成方面取得了显著的成功,但仍面临(1)物理对齐和(2)跨分布(OOD)指令跟随两个挑战。我们认为,这些问题源于模型未能学习因果方向以及未能解耦以进行新颖组合的因果因素。我们引入因果场景图(CSG)和物理对齐探针(PAP)数据集以实现诊断性干预。该分析揭示了三个关键见解:首先,DMs在处理提示中未明确确定的要素的多跳推理方面困难;其次,提示嵌入包含纹理和物理的解耦表示;最后,视觉因果结构在最初的、计算受限的去噪步骤中得以建立。基于这些发现,我们提出LINA(Learning INterventions Adaptively),一种新型框架,通过学习预测提示特定的干预来实现自适应学习,采用(1)提示和视觉潜在空间中的精准引导,以及(2)重新分配的、以因果为导向的去噪计划。我们的方案在图像和视频DMs中实现了物理对齐和OOD指令跟随,在具有挑战性的因果生成任务和Winoground数据集上实现了最先进的性能。我们的项目页面位于https://opencausalab.github.io/LINA。
引用
@article{arxiv.2512.13290,
title = {LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models},
author = {Shu Yu and Chaochao Lu},
journal= {arXiv preprint arXiv:2512.13290},
year = {2025}
}