中文

KGEdit:用于训练-free 精确视频生成与编辑的模糊感知知识图谱

计算机视觉与模式识别 2026-05-29 v1

摘要

近年来,训练-free 视频生成取得了显著进展。然而,在处理复杂文本指令时,现有方法仍 suffer 语义模糊、概念绑定错误以及跨帧不一致等问题。为此,我们提出了 KGEdit,这是一个用于文本到视频(T2V)扩散模型的结构化语义控制框架。具体而言,我们首先构建模糊感知知识图谱(AAKG),将输入提示分解为身份、关系、属性和负面约束四种结构化语义。随后,我们设计了结构化语义注入模块(SSIM),将这些语义信号注入扩散 Transformer 的关键层,实现精细的语义控制。此外,我们引入了时序感知语义控制(TASC)模块,根据去噪过程的阶段特性动态安排语义目标,从而进一步提高语义对齐和时序一致性。实验表明,KGEdit 在编辑精度和时序稳定性方面优于现有方法,同时在文本驱动的交互场景中提供更高的效率和可控性。

关键词

引用

@article{arxiv.2605.29509,
  title  = {KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing},
  author = {Mingshu Cai and Miao Zhang and Chenghe Yang and Yixuan Li and Osamu Yoshie and Yuya Ieiri},
  journal= {arXiv preprint arXiv:2605.29509},
  year   = {2026}
}