时间序列、视觉与语言:探索对比表示空间中对齐的极限
人工智能
2026-02-24 v1 计算机视觉与模式识别
摘要
完美化表示假设 (Platonic Representation Hypothesis) 认为,来自不同模态模型训练得到的表示会收敛到世界的共享潜在结构。然而,这一假设主要在视觉和语言领域得到探讨,时间序列是否参与此类收敛仍不明确。我们首先在三模态设置中进行检查,发现独立预训练的时间序列、视觉和语言编码器在缺乏显式耦合时表现出接近正交的几何结构。随后,我们通过在冻结编码器上训练投影头进行后处理对齐,并分析 resulting representations 相对于几何、扩展行为以及信息密度和输入模态特征的依赖性。我们的调查结果表明,对比表示空间中的整体对齐随模型规模而改善,但这种对齐是非对称的:时间序列更强地与视觉表示对齐,而与文本对齐较弱,图像可作为时间序列与语言之间有效的中介。我们进一步发现,更丰富的文本描述仅能提升对齐至一定阈值;训练于更密集的标题并不会带来进一步的改进。类似效应也见于视觉表示。我们的发现为构建涉及非传统数据模态(超越视觉和语言)的多模态系统提供了考虑因素。
引用
@article{arxiv.2602.19367,
title = {Time Series, Vision, and Language: Exploring the Limits of Alignment in Contrastive Representation Spaces},
author = {Pratham Yashwante and Rose Yu},
journal= {arXiv preprint arXiv:2602.19367},
year = {2026}
}
备注
24 Figures, 12 Tables