中文

MATRIX:面向交互感知的视频生成的掩码轨迹对齐

计算机视觉与模式识别 2026-04-08 v2

摘要

视频 DiTs 在视频生成方面取得了进展,但仍难以建模多实例或主体-客体交互。这引出了一个关键问题:这些模型如何内部表示交互?为此,我们策划了 MATRIX-11K,一个包含交互感知标题和多实例掩码轨迹的视频数据集。使用该数据集,我们进行了系统性分析,将视频 DiTs 的两个视角形式化为:语义 grounding,通过视频到文本注意力评估名词和动词 token 是否捕获实例及其关系;语义 propagation,通过视频到视频注意力评估实例绑定是否在帧之间持久存在。我们发现,这两个作用都集中在少数少数交互主导层中。基于此,我们引入 MATRIX,一种简单有效的正则化方法,将视频 DiTs 特定层的注意力与 MATRIX-11K 数据集中的多实例掩码轨迹对齐,以增强 grounding 和 propagation。我们进一步提出 InterGenEval,一个用于交互感知视频生成的评估协议。实验表明,MATRIX 在提升交互保真度和语义对齐的同时,减少漂移和幻觉。广泛的消融实验验证了我们的设计选择。将发布代码和模型权重。

关键词

引用

@article{arxiv.2510.07310,
  title  = {MATRIX: Mask Track Alignment for Interaction-aware Video Generation},
  author = {Siyoon Jin and Seongchan Kim and Dahyun Chung and Jaeho Lee and Hyunwook Choi and Jisu Nam and Jiyoung Kim and Seungryong Kim},
  journal= {arXiv preprint arXiv:2510.07310},
  year   = {2026}
}

备注

Project Page is available at: https://cvlab-kaist.github.io/MATRIX/, ICLR 2026