晶体 latent:多模态大语言模型中视觉潜在变量的自发涌现
计算机视觉与模式识别
2026-03-10 v2 人工智能
摘要
多模态大语言模型(MLLMs)通过整合强大的语言主干和大规模视觉编码器实现了显著的性能提升。在其中一些模型中,潜在链式思维(latent Chain-of-Thought, CoT)方法使隐式推理在连续隐藏状态中实现,从而促进了无缝的视觉-语言集成和更快的推理。然而,现有的基于启发式预定义监督信号的潜在 CoT 提供有限的指导来保存中间潜在状态中关键视觉信息。为解决这一限制,我们提出了 CrystaL(晶体化潜在推理),一个单阶段框架,包含两个路径分别处理完整图像和受损图像。通过在两个路径之间显式地对齐注意力模式和预测分布,CrystaL 将潜在表示结晶为任务相关的视觉语义,无需依赖辅助注释或外部模块。大量实验在感知密集型基准测试上表明,CrystaL 在各类最先进的基准方法上 consistently 取得显著优势,在细粒度视觉理解方面实现了 substantial 改进,同时保持了稳健的推理能力。
引用
@article{arxiv.2602.20980,
title = {CrystaL: Spontaneous Emergence of Visual Latents in MLLMs},
author = {Yang Zhang and Danyang Li and Yuxuan Li and Xin Zhang and Tianyu Xie and Mingming Cheng and Xiang Li},
journal= {arXiv preprint arXiv:2602.20980},
year = {2026}
}