中文

VisionLaw:通过双层优化从视觉观察推断可解释的本征动力学

计算机视觉与模式识别 2026-04-13 v2

摘要

物体的本征动力学支配其在现实世界中的物理行为,在实现与三维资产相关的物理可行交互仿真方面发挥着关键作用。现有方法通常面临两个主要挑战:一方面,某些工作依赖手动定义的本构先验条件,难以与实际的本征动力学一致;另一方面,用神经网络建模本征动力学,导致可解释性有限且泛化性差。为此,我们提出了VisionLaw,一个双层优化框架,用于从视觉观察中推断可解释的本征动力学表达式。在上层, 我们引入了LLM驱动的解耦本构演化策略,其中LLM被激活以物理专家身份生成和修订本构规律,并内置解耦机制显著降低LLM的搜索复杂度。在下层,我们引入了视觉引导的本构评估机制,该机制利用视觉仿真来评估生成的本构规律与潜在本征动力学之间的一致性,从而引导上层演化。在针对合成数据和真实世界数据集的实验中表明,VisionLaw能够有效地从视觉观察中推断出可解释的本征动力学。它显著优于现有最先进的方法,并在新情景下的交互仿真中表现出强大的泛化能力。

关键词

引用

@article{arxiv.2508.13792,
  title  = {VisionLaw: Inferring Interpretable Intrinsic Dynamics from Visual Observations via Bilevel Optimization},
  author = {Jiajing Lin and Shu Jiang and Qingyuan Zeng and Zhenzhong Wang and Min Jiang},
  journal= {arXiv preprint arXiv:2508.13792},
  year   = {2026}
}

备注

Accepted by ICLR 2026; Project Page: https://github.com/JiajingLin/VisionLaw