KGEdit:用于训练-free 精确视频生成与编辑的模糊感知知识图谱
计算机视觉与模式识别
2026-05-29 v1
摘要
近年来,训练-free 视频生成取得了显著进展。然而,在处理复杂文本指令时,现有方法仍 suffer 语义模糊、概念绑定错误以及跨帧不一致等问题。为此,我们提出了 KGEdit,这是一个用于文本到视频(T2V)扩散模型的结构化语义控制框架。具体而言,我们首先构建模糊感知知识图谱(AAKG),将输入提示分解为身份、关系、属性和负面约束四种结构化语义。随后,我们设计了结构化语义注入模块(SSIM),将这些语义信号注入扩散 Transformer 的关键层,实现精细的语义控制。此外,我们引入了时序感知语义控制(TASC)模块,根据去噪过程的阶段特性动态安排语义目标,从而进一步提高语义对齐和时序一致性。实验表明,KGEdit 在编辑精度和时序稳定性方面优于现有方法,同时在文本驱动的交互场景中提供更高的效率和可控性。
引用
@article{arxiv.2605.29509,
title = {KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing},
author = {Mingshu Cai and Miao Zhang and Chenghe Yang and Yixuan Li and Osamu Yoshie and Yuya Ieiri},
journal= {arXiv preprint arXiv:2605.29509},
year = {2026}
}