TRANSPORTER:从 VLM 流形传递视觉语义
计算机视觉与模式识别
2026-04-08 v2
摘要
视频理解模型如何获取其答案?尽管当前的视觉语言模型(VLM)能够在具有多样化物体、动作表现和场景动态的复杂场景中进行推理,但对其内部过程的理解和控制仍然是一个开放的挑战。受最近在文本到视频(T2V)生成模型方面取得进展的启发,本文引入一种 logits 到视频(L2V)任务,并提出一种模型无关的方法——TRANSPORTER——来生成捕捉 VLMs 预测背后规则的视频。鉴于 T2V 模型产生的高视觉保真度,TRANSPORTER 学习将 VLM 的高语义嵌入空间进行最优传输耦合。相对于,logit 分数定义嵌入方向用于条件视频生成。TRANSPORTER 生成反映不同物体属性、动作副词和场景上下文变化的视频。跨 VLMs 的定性和定量评估表明,L2V 可以为模型可解释性提供一条 fidelity-rich、尚未探索的新方向。
引用
@article{arxiv.2511.18359,
title = {TRANSPORTER: Transferring Visual Semantics from VLM Manifolds},
author = {Alexandros Stergiou},
journal= {arXiv preprint arXiv:2511.18359},
year = {2026}
}
备注
Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Project page: https://alexandrosstergiou.github.io/TRANSPORTER