通过自监督微调解锁通用编辑:超越生成
计算机视觉与模式识别
2025-03-19 v2 人工智能
摘要
近期视频生成技术的进展已快于视频编辑的进展,而视频编辑仍受到若干限制因素的制约,即:(a) 任务对监督依赖严格限制了普遍性,(b) 生成与编辑任务之间不必要的人为分离,以及(c) 训练视频模型的高计算成本。本文提出了 UES(通过自监督微调解锁通用编辑),一种轻量级自监督微调策略,通过自监督语义对齐将生成模型转化为统一的生成-编辑系统。我们的做法建立了双条件机制,使原始视频文本对共同提供视觉和文本语义,从而实现对内在时空对应关系的结构化学习。关键优势包括:(i) 通过无监督适应实现通用性,以适应各种编辑任务,(ii) 将生成与编辑统一,可适用于大多数文本(加图像)-到视频模型,以及(iii) 通过轻量级微调将可调参数减少92.67%。为实现系统评估,我们引入OmniBench-99,一个涵盖99个视频的综合基准,包括人类/动物、环境和物体, comprising(包含)4种编辑类型和8种场景。广泛实验表明,UES使那些不具备内置编辑功能的模型能够进行强大且通用的编辑,同时保持甚至提升其原始生成性能。
引用
@article{arxiv.2412.02114,
title = {Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning},
author = {Harold Haodong Chen and Harry Yang and Ser-Nam Lim},
journal= {arXiv preprint arXiv:2412.02114},
year = {2025}
}
备注
Project: https://haroldchen19.github.io/UES-Page/