连接器存活什么语义?诊断VLM到DiT在视频编辑中的对齐
计算机视觉与模式识别
2026-05-21 v1
摘要
基于流匹配的视频生成模型日益依赖前置视觉语言模型(VLM)来处理复杂的、基于指令的视频编辑。当前范式的主要假设是,连接器模块可以无缝地将VLM的丰富多模态推理与DiT原始文本嵌入空间对齐。然而,我们假设这种对齐充当严重的语义瓶颈,导致细粒度结构变量退化。验证这一假设具有挑战性,因为端到端评估会将对齐失败与生成错误混合,而自然数据集缺乏解耦标注。为严格检验此假设,我们提出基于视频组成的受控数据处理流程, resulting in TRACE-Edit 一个聚焦于关系导向编辑的诊断数据集。利用该数据集,我们提出了综合性诊断协议,用于分析现有视频编辑模型中两种重要的设计:meta查询和连接器。系统评估四个代表性模型案例发现,细粒度结构语义在对齐过程中可能严重退化。我们的发现推翻了无损语义传递的假设,识别VLM到DiT对齐作为主要瓶颈,并为未来多模态对齐架构提供了新的诊断基础。
引用
@article{arxiv.2605.20795,
title = {What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing},
author = {Hangyu Lin and Chao Wen and Chengming Xu and Jianxiong Gao and Jiangning Zhang and Xiaobin Hu and Yanwei Fu},
journal= {arXiv preprint arXiv:2605.20795},
year = {2026}
}