中文

TTOM:用于组合视频生成的测试时优化与记忆

计算机视觉与模式识别 2026-03-03 v2 人工智能 计算与语言 机器学习 多媒体

摘要

视频基础模型(VFM)在视觉生成方面表现突出,但在组合场景(如运动、数感和空间关系)中存在挑战。本文引入测试时优化与记忆(TTOM),一个无需训练的框架,在推理期间将 VFM 输出与时空布局对齐,以实现更好的文本-图像对齐。不同于现有方法对潜在表示或注意力进行直接干预,本文集成并优化由通用布局注意力目标引导的新参数。此外,我们将视频生成形式化为流式设置,并通过参数化记忆机制维持历史优化上下文,支持插入、读取、更新和删除等灵活操作。值得注意的是,我们发现 TTOM 能解耦组合世界知识,展现出强大的可迁移性和泛化能力。在 T2V-CompBench 和 Vbench 框架上的实验结果表明,TTOM 是实现组合视频生成中跨模态对齐的有效、实用、可扩展且高效的框架。

关键词

引用

@article{arxiv.2510.07940,
  title  = {TTOM: Test-Time Optimization and Memorization for Compositional Video Generation},
  author = {Leigang Qu and Ziyang Wang and Na Zheng and Wenjie Wang and Liqiang Nie and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2510.07940},
  year   = {2026}
}

备注

ICLR 2026 Camera-ready. Project page: https://ttom-t2v.github.io/