中文

EMMA:从多模态数据中提取多个物理参数

计算机视觉与模式识别 2026-05-26 v1

摘要

我们介绍 EMMA,一个受物理约束的多模态框架,可直接从原始视频、音频和基于图像的时间序列观察中恢复系统的可识别动力学参数。与专注于视频单一模态且在遮挡状态、隐藏作动输入或已知初始条件和坐标系假设方面受限的先前方法不同,EMMA 在统一的连续时间模型中执行显式参数、隐式动力学组件和校准不变项的联合推断。EMMA 利用液体时间常数(LTC)网络从异构模态中学习潜在动力学,同时通过受物理约束的损失函数确保与支配微分方程的一致性。统一的特征管道使视频轨迹、声学特征和图表测量值能够保持一致,对受控、隐式和多变量动力学系统进行参数估计,无需分割掩码、可微渲染或专业传感器。在100多个场景中,包括五个标准动力学基准测试(75个 Delfys 视频)、带有隐藏输入的真实无人车和四旋翼机系统,以及生物和混沌系统的仿真-图表案例研究中,EMMA 能可靠地实现多参数恢复,并显著优于现有的单模态方法和方程发现基准方法。我们的结果表明,EMMA 是从机会主义多模态数据中实现物理一致模型提取的通用、可扩展解决方案。代码和数据可在 https://github.com/ImpactLabASU/EMMA-CVPR2026 获取。

关键词

引用

@article{arxiv.2605.24047,
  title  = {EMMA: Extracting Multiple physical parameters from Multimodal Data},
  author = {Farhat Shaikh and Ayan Banerjee and Sandeep Gupta},
  journal= {arXiv preprint arXiv:2605.24047},
  year   = {2026}
}

备注

Accepted at CVPR 2026 (main conference)