模仿物理学家的视野:基于视觉语言模型的物理公式发现方法
人工智能
2025-08-26 v1
摘要
从观测数据中自动发现物理规律是人工智能中的一大挑战。当前方法依赖符号回归或大语言模型,仅能处理单模态数据,忽视了物理学家不可或缺的运动视觉现象表征。这种“感官剥夺”严重削弱了其解释动态现象中内在时空模式的能力。为此,我们提出了 VIPER-R1,一种用于物理方程推理的多模态模型,旨�通过视觉诱导发现物理方程。该模型集成了视觉感知、轨迹数据与符号推理,模拟科学发现过程。模型通过运动结构诱导课程进行训练,利用监督微调解读运动相位图,并借助因果链思考(Causal Chain of Thought, C-CoT)构建假设,随后通过奖励引导的符号校准(Reward-Guided Symbolic Calibration, RGSC)利用强化学习细化公式结构。在推理阶段,训练好的 VIPER-R1 充当智能体:首先提出高置信度的符号猜测,然后主动调用外部符号回归工具执行符号残差实ignment(Symbolic Residual Realignment, SR²)。这一步类似于物理学家的扰动分析,使理论模型与实验数据相吻合。为支持本研究,我们引入了包含 5000 条实例的多模态语料库 PhysSymbol。实验表明,VIPER-R1 在准确率和可解释性方面 consistently 优于最先进的视觉语言模型基线,实现了更精确的物理规律发现。项目页面: https://jiaaqiliu.github.io/VIPER-R1/
引用
@article{arxiv.2508.17380,
title = {Mimicking the Physicist's Eye:A VLM-centric Approach for Physics Formula Discovery},
author = {Jiaqi Liu and Songning Lai and Pengze Li and Di Yu and Wenjie Zhou and Yiyang Zhou and Peng Xia and Zijun Wang and Xi Chen and Shixiang Tang and Lei Bai and Wanli Ouyang and Mingyu Ding and Huaxiu Yao and Aoran Wang},
journal= {arXiv preprint arXiv:2508.17380},
year = {2025}
}