中文

VibraVerse:用于物理一致性多模态学习的大规模几何-声学对齐数据集

人工智能 2025-11-26 v1 计算机视觉与模式识别 图形学 机器人学

摘要

理解物理世界需要建立基于物理定律的感知模型,而非仅依赖统计相关性。然而,现有的多模态学习框架侧重于视觉和语言,缺乏物理一致性,忽略了物体几何、材料、振动模式及其产生声响之间内在的因果关系。我们引入VibraVerse,这是一个大规模几何-声学对齐数据集,显式构建了从3D几何→物理属性→模态参数→声学信号的因果链。每个3D模型都包含明确的物理属性(密度、杨氏模量、泊松比)和体积几何,从而计算出冲击声合成的模态本振频率和本振形。为建立这种一致性,我们提出CLASP(对比学习框架),实现跨模态对齐,保留物体物理结构与声学响应之间的因果对应关系。该框架确保跨模态的物理一致对齐,保证每个样本都与支配方程相关联,并嵌入覆盖形状、图像和声音的统一表示空间。基于VibraVerse,我们定义了一系列基准任务,包括几何到声的预测、声导向形状重建和跨模态表示学习。对这些任务进行的广泛验证表明,在VibraVerse上训练的模型在准确性、可解释性和跨模态泛化能力方面表现优异。这些结果将VibraVerse确立为物理一致性和因果可解释多模态学习的基准,为声导向具身感知和对物理世界的深入理解提供了基础。该数据集将开源发布。

关键词

引用

@article{arxiv.2511.20422,
  title  = {VibraVerse: A Large-Scale Geometry-Acoustics Alignment Dataset for Physically-Consistent Multimodal Learning},
  author = {Bo Pang and Chenxi Xu and Jierui Ren and Guoping Wang and Sheng Li},
  journal= {arXiv preprint arXiv:2511.20422},
  year   = {2025}
}