中文

锚点出发!前往最优统一多模态表示

机器学习 2025-10-08 v3 计算机视觉与模式识别 机器学习

摘要

多模态学习中的统一表示空间对于有效整合诸如文本、图像和音频等异构数据源以提高跨各种下游任务的效率和性能至关重要。最近的绑定方法,如 ImageBind,typically rely on a single, fixed anchor modality for aligning multi-modal data. 我们对这些固定锚点绑定方法进行数学分析,发现显著局限性:(1) 对锚点模态选择过度依赖,(2) 不足以捕捉模内信息,(3) 未能考虑非锚点模态之间的跨模态相关性。为解决这些问题,我们提出需要自适应锚点绑定方法,以我们的框架 CentroBind 为例。该方法使用来自所有可用模态的可调中心-based锚点,导致均衡且丰富的表示空间。我们理论上表明,我们的方法捕捉了多模态学习的三个关键属性——模内学习、模间学习和多模态对齐——同时构建覆盖所有模态的统一表示。在 synthetic和 real-world数据集上的实验表明,像 CentroBind 这样的自适应锚点方法持续优于固定锚点绑定方法,证实了我们的分析。

关键词

引用

@article{arxiv.2410.02086,
  title  = {Anchors Aweigh! Sail for Optimal Unified Multi-Modal Representations},
  author = {Minoh Jeong and Zae Myung Kim and Min Namgung and Dongyeop Kang and Yao-Yi Chiang and Alfred Hero},
  journal= {arXiv preprint arXiv:2410.02086},
  year   = {2025}
}