TV-LiVE:基于层级信息摄取的训练-free 文本导引视频编辑
计算机视觉与模式识别
2025-06-10 v1
摘要
视频编辑正因扩散式视频生成模型的快速发展而受到广泛关注。作为这些进展的一部分,亟需更易于掌控且可访问的视频编辑形式,如基于提示的编辑。以往研究主要聚焦于风格迁移、背景替换、物体置换及属性修改等任务,同时保持源视频的内容结构。然而,对于更为复杂的任务(如新增物体及非刚性变形),的研究仍相对不足。本文提出TV-LiVE(Training-free and text-guided Video editing framework via Layer-informed Vitality Exploitation),一种基于层级信息摄取的训练-free 文本导引视频编辑框架。我们经验性地识别出视频生成模型中对生成输出质量影响显著的关键层,这些层与旋转位置嵌入(Rotary Position Embeddings, RoPE)密切相关。基于此,我们的方法通过在目标模型中选择性地注入源模型的关键值特征,实现物体添加及非刚性视频编辑。对于物体添加,我们进一步识别出关键层以提取新增目标提示对应的掩码区域。我们发现,从关键层提取的掩码能准确指示待编辑区域。实验结果表明,TV-LiVE 在物体添加及非刚性视频编辑任务上均优于现有方法。项目页面:https://emjay73.github.io/TV_LiVE/
引用
@article{arxiv.2506.07205,
title = {TV-LiVE: Training-Free, Text-Guided Video Editing via Layer Informed Vitality Exploitation},
author = {Min-Jung Kim and Dongjin Kim and Seokju Yun and Jaegul Choo},
journal= {arXiv preprint arXiv:2506.07205},
year = {2025}
}