通过概念空间对齐实现统一视觉语言建模
计算机视觉与模式识别
2026-03-03 v1 人工智能
计算与语言
机器学习
摘要
我们提出V-SONAR,一种从仅支持1500种文本语言和177种语音语言的文本嵌入空间扩展而来的视觉语言嵌入空间。为构建V-SONAR,我们提出一种后验对齐管线,将现有视觉编码器的表示映射到SONAR空间中。我们全面评估了V-SONAR,表明其嵌入在文本到视频检索任务上性能可competitive。配合OMNISONAR文本解码器,V-SONAR在视频描述任务上超越了当前最先进的视觉语言模型,包括DREAM-1K (BLEU 23.9 vs. 19.6) 和PE-VIDEO (BLEU 39.0 vs. 30.0)。利用V-SONAR,我们首次表明在SONAR中仅用英文文本训练的大概念模型 (LCM; LCM团队等,2024) 能以零样本方式执行单目标和多目标视觉概念理解。最后,我们提出V-LCM,将LCM与视觉语言指令调谐相结合。V-LCM通过V-SONAR和SONAR将视觉和语言输入编码为统一的潜在嵌入序列,并采用与LCM文本-only预训练相同的潜在扩散目标进行训练,以进行下一个嵌入的预测。实验表明,在大规模多语言和多模态指令调谖数据混合物中,V-LCM的潜力巨大:V-LCM在覆盖图像/视频描述和问答等任务的state-of-the-art视觉语言模型上保持一致性能,同时在61种从丰富到贫乏的语言中显著优于所有62种测试语言中的其他模型。
引用
@article{arxiv.2603.01096,
title = {Unified Vision-Language Modeling via Concept Space Alignment},
author = {Yifu Qiu and Paul-Ambroise Duquenne and Holger Schwenk},
journal= {arXiv preprint arXiv:2603.01096},
year = {2026}
}
备注
ICLR 2026