中文

TRANSPORTER:从 VLM 流形传递视觉语义

计算机视觉与模式识别 2026-04-08 v2

摘要

视频理解模型如何获取其答案?尽管当前的视觉语言模型(VLM)能够在具有多样化物体、动作表现和场景动态的复杂场景中进行推理,但对其内部过程的理解和控制仍然是一个开放的挑战。受最近在文本到视频(T2V)生成模型方面取得进展的启发,本文引入一种 logits 到视频(L2V)任务,并提出一种模型无关的方法——TRANSPORTER——来生成捕捉 VLMs 预测背后规则的视频。鉴于 T2V 模型产生的高视觉保真度,TRANSPORTER 学习将 VLM 的高语义嵌入空间进行最优传输耦合。相对于,logit 分数定义嵌入方向用于条件视频生成。TRANSPORTER 生成反映不同物体属性、动作副词和场景上下文变化的视频。跨 VLMs 的定性和定量评估表明,L2V 可以为模型可解释性提供一条 fidelity-rich、尚未探索的新方向。

关键词

引用

@article{arxiv.2511.18359,
  title  = {TRANSPORTER: Transferring Visual Semantics from VLM Manifolds},
  author = {Alexandros Stergiou},
  journal= {arXiv preprint arXiv:2511.18359},
  year   = {2026}
}

备注

Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Project page: https://alexandrosstergiou.github.io/TRANSPORTER