中文

MMOne:将多模态表示于一个场景中

计算机视觉与模式识别 2025-07-18 v2 人工智能 机器学习

摘要

人类通过多模态线索来理解和与环境互动。学习用于多模态的场景表示可增强对物理世界的理解。然而,由于不同模态固有区别,导致两大关键挑战:属性差异和 granularity 差异。为解决这些挑战,我们提出一种通用框架 MMOne,用于将多模态表示于一个场景中,可轻松扩展到额外模态。具体而言,我们提出具有新颖模态指示器的模态建模模块,以捕捉每个模态的独特属性。此外,我们设计了多模态分解机制,将多模态高斯分布基于模态差异分解为单模态高斯分布。我们通过将多模态信息解耦为共享和模态特定组件来处理模态间的本质区别, resulting 在更紧凑且高效的多模态场景表示。广泛实验表明,我们的方法能一致增强每个模态的表示能力,并可扩展到额外模态。代码已公开于 https://github.com/Neal2020GitHub/MMOne。

关键词

引用

@article{arxiv.2507.11129,
  title  = {MMOne: Representing Multiple Modalities in One Scene},
  author = {Zhifeng Gu and Bing Wang},
  journal= {arXiv preprint arXiv:2507.11129},
  year   = {2025}
}

备注

Accepted to ICCV 2025