锚定强制:桥接时间无关语义与局部动力学的自回归视频合成
计算机视觉与模式识别
2026-04-14 v2
摘要
自回归视频合成为无限视角生成提供了有前景的路径,但因语义忘记、视觉漂移和交互式指令切换中的可控性丢失三个交织挑战而受到根本性阻碍。现有方法常孤立地解决这些问题,限制了长期一致性。我们提出锚定强制框架,通过三重互锁机制桥接时间无关语义与局部动力学。首先,为解决语义忘记,提出双记忆KV缓存,将局部时间动力学与全局语义锚点解耦,确保长期语义一致性和身份稳定性。其次,为抑制视觉漂移,设计双参考RoPE注入,将位置嵌入限制于训练流形范围内,使全局语义保持时间不变。再次,为解决可控性问题,开发非对称邻近缓存,以邻近加权缓存更新促进提示转换期间的语义继承。这三大组件协同工作,将生成过程锚定于稳定语义核心,同时容纳灵活的局部动力学。广泛实验表明,锚定强制显著提升远期一致性和视觉稳定性,为交互式长时段视频合成奠定了稳健基础。
引用
@article{arxiv.2604.06939,
title = {Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis},
author = {Jintao Chen and Chengyu Bai and Junjun Hu and Xinda Xue and Mu Xu},
journal= {arXiv preprint arXiv:2604.06939},
year = {2026}
}