SPATIALALIGN:视频生成中动态空间关系的对齐
计算机视觉与模式识别
2026-03-02 v2
摘要
大多数文本到视频(T2V)生成器侧重于审美质量,却忽略了生成视频中的空间约束。本文提出了 SPATIALALIGN,一个自我改进框架,以增强 T2V 模型描绘文本提示中动态空间关系(DSR)的能力。我们设计了一种零阶正则化的直接偏好优化(DPO)以微调 T2V 模型,使其更好地与 DSR 对齐。具体而言,我们构建了 DSR-SCORE 评估指标,通过几何方法量化生成视频与提示中指定 DSR 的对齐程度,较之依赖视觉语言模型(VLM)的评估方法具有一步之遥。我们还构建了一个包含多样化 DSR 的文本-视频配对数据集,以促进相关研究。大量实验表明,经微调的模型在空间关系方面显著优于基线模型。代码将在链接处发布。项目页面:https://fengming001ntu.github.io/SpatialAlign/
引用
@article{arxiv.2602.22745,
title = {SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation},
author = {Fengming Liu and Tat-Jen Cham and Chuanxia Zheng},
journal= {arXiv preprint arXiv:2602.22745},
year = {2026}
}
备注
Project page: https://fengming001ntu.github.io/SpatialAlign/