何时锁定注意力:基于训练-free 方法的视频扩散中的 KV 控制
计算机视觉与模式识别
2026-03-11 v1 人工智能
新兴技术
图像与视频处理
摘要
在视频编辑中,保持背景一致性的同时提升前景质量仍是核心挑战。注入完整图像信息常导致背景伪影,而刚性锁定背景则严格限制模型的前景生成能力。为此,我们提出 KV-Lock—a 一个针对 DiT 基于视频扩散模型的训练-free 框架。我们的核心洞见是,幻觉指标(去噪预测方差)直接量化生成多样性,这与无条件指导 (CFG) 比例本质上相关。基于此,KV-Lock 利用扩散幻觉检测,动态调度两个关键组件:缓存背景 key-value (KV) 与新生成 KV 之间的融合比例,以及 CFG 比例。当检测到幻觉风险时,KV-Lock 加强背景 KV 锁定,同时放大前景生成的条件指导,从而减轻伪影并提高生成保真度。作为训练-free、即插即用模块,KV-Lock 可轻松集成到任何预训练的 DiT 基于模型中。广泛实验验证表明,我们的方法在提升前景质量的同时,实现了更高的背景保真度,在各种视频编辑任务中均优于现有方法。
引用
@article{arxiv.2603.09657,
title = {When to Lock Attention: Training-Free KV Control in Video Diffusion},
author = {Tianyi Zeng and Jincheng Gao and Tianyi Wang and Zijie Meng and Miao Zhang and Jun Yin and Haoyuan Sun and Junfeng Jiao and Christian Claudel and Junbo Tan and Xueqian Wang},
journal= {arXiv preprint arXiv:2603.09657},
year = {2026}
}
备注
18 pages, 9 figures, 3 tables