中文

面向创意视频生成的知识驱动方法:KD-CVG

计算机视觉与模式识别 2026-04-24 v1

摘要

创意生成(CG)利用生成模型自动生成突出产品特征的广告内容,近年来成为重要研究方向。然而,尽管CG在文本和图像生成方面取得显著进展,创意视频生成(CVG)仍属薄弱环节。这主要源于文本到视频(T2V)模型面临两个主要挑战:(a) 模型难以准确关联产品卖点与创意视频内容之间的模糊语义对齐问题,(b) 运动适应性不足导致不真实的运动和变形。为此,我们构建了综合性广告创意知识库(ACKB),并提出知识驱动方法(KD-CVG)以克服现有模型的知识局限。KD-CVG包含两个核心模块:语义感知检索(SAR)和多模态知识参考(MKR)。SAR利用图注意力网络的语义感知能力和强化学习反馈,增强模型对卖点与创意视频之间联系的理解。基于此,MKR将语义和运动先验纳入T2V模型,以解决知识鸿沟。广泛实验表明,KD-CVG在实现语义对齐和运动适应性方面表现优异,验证了其相较于其他最先进方法的有效性。代码和数据集将开源于https://kdcvg.github.io/KDCVG/。

关键词

引用

@article{arxiv.2604.21362,
  title  = {KD-CVG: A Knowledge-Driven Approach for Creative Video Generation},
  author = {Linkai Liu and Wei Feng and Xi Zhao and Shen Zhang and Xingye Chen and Zheng Zhang and Jingjing Lv and Junjie Shen and Ching Law and Yuchen Zhou and Zipeng Guo and Chao Gou},
  journal= {arXiv preprint arXiv:2604.21362},
  year   = {2026}
}

备注

Accepted to ICASSP 2026