TokenDial: 通过时空 Token 偏移实现文本到视频中的连续属性控制
计算机视觉与模式识别
2026-03-31 v1
摘要
我们提出了 TokenDial,一个用于在预训练的文本到视频生成模型中进行连续、滑块式属性控制的框架。虽然现代生成器能生成强大的整体视频,但它们对属性变化程度(例如,效果强度或运动幅度)的控制有限,且难以保持身份、背景或时间一致性。TokenDial 基于以下观察:中间时空视觉补丁 token 空间中的加性偏移形成了一个语义控制方向,调整偏移幅度可以对外观和运动动态产生连贯、可预测的编辑。我们在不重新训练主干网络的情况下,利用预训练的理解信号来学习特定属性的 token 偏移:用于外观的语义方向匹配和用于运动的运动幅度缩放。我们在多种属性和提示上展示了 TokenDial 的有效性,与最先进的基线方法相比,实现了更强的可控性和更高质量的编辑,这得到了广泛的定量评估和人类研究的支持。
引用
@article{arxiv.2603.27520,
title = {TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets},
author = {Zhixuan Liu and Peter Schaldenbrand and Yijun Li and Long Mai and Aniruddha Mahapatra and Cusuh Ham and Jean Oh and Jui-Hsien Wang},
journal= {arXiv preprint arXiv:2603.27520},
year = {2026}
}
备注
Project page: https://tokendial.github.io/