中文

基于预测嵌入的多模态潜在推理

机器学习 2026-04-10 v1

摘要

工具增强型多模态推理使视觉语言模型(VLMs)能够通过与外部工具(如裁剪、深度估计)交互来提高感知能力,但此类方法面临显著的推理开销、需要专业监督,且易产生错误工具调用。我们提出 Pearl(Predictive Embedding Alignment for Reasoning in Latent space),一种受 JEPA 启发的框架,完全在潜在空间从专家工具使用轨迹中学习,无需在推理时显式调用工具。不同于基于重建的潜在推理方法后验生成潜在 token 并因训练-推理不匹配和难以支持多步骤工具使用的局限,Pearl 直接从多模态轨迹学习预测嵌入,同时保留标准视觉语言生成管道:它与模型无关、易于训练,自然支持包含多个工具调用的轨迹。跨多个感知基准的实验表明,Pearl 能匹配或超越标准监督微调和基于重建的潜在推理方法。进一步,我们提供实证证据表明,基于重建的方法主要在潜在空间学习嵌入而非图像编辑,动机是将预测嵌入学习作为更原则性的替代方案。

关键词

引用

@article{arxiv.2604.08065,
  title  = {Multimodal Latent Reasoning via Predictive Embeddings},
  author = {Ashutosh Adhikari and Mirella Lapata},
  journal= {arXiv preprint arXiv:2604.08065},
  year   = {2026}
}