Indra 表示假设:多模态对齐研究
计算机视觉与模式识别
2026-04-07 v1
摘要
近期研究发现了一个有趣的现象:单模态基础模型倾向于学习收敛的表征,无论架构、训练目标或数据模态存在何种差异。然而,这些表征本质上是对样本的内部抽象,独立地刻画样本,导致表达能力有限。本文提出了“Indra 表示假设”,灵感来自印度的哲学隐喻。我们认为,单模态基础模型的表征正在收敛于隐式地反映现实中潜在的共享关系结构,类似于印度网的关系本体论。我们运用范畴论中的 V-丰富 Yoneda 嵌入来正式化此假设,定义 Indra 表示为每个样本相对于其他样本的关系轮廓。该表述在给定代价函数下具有唯一性、完备性和结构保持性。我们采用角距离实现 Indra 表示,并在涉及视觉、语言和音频的跨模型和跨模态场景中进行评估。广泛的实验表明,Indra 表示在不同架构和模态之间持续增强鲁棒性和对齐,提供了一个在理论上有据可依且在实践中有效的框架,用于无训练对齐单模态基础模型。我们的代码已公开于 https://github.com/Jianglin954/Indra。
引用
@article{arxiv.2604.04496,
title = {The Indra Representation Hypothesis for Multimodal Alignment},
author = {Jianglin Lu and Hailing Wang and Kuo Yang and Yitian Zhang and Simon Jenni and Yun Fu},
journal= {arXiv preprint arXiv:2604.04496},
year = {2026}
}