RASA:替换任何人,说任何事——一种免训练的音频驱动通用肖像视频编辑框架
计算机视觉与模式识别
2025-03-17 v1 人工智能
摘要
肖像视频编辑侧重于在音频或视频流的引导下修改肖像视频的特定属性。以往的方法通常要么集中于唇部区域重演,要么需要训练专门的模型来提取关键点,以将运动迁移到新身份上。本文引入了一种免训练的通用肖像视频编辑框架,提供了一种通用且适应性强的编辑策略。该框架支持以更改后的第一参考帧为条件的肖像外观编辑,以及以不同语音为条件的唇部编辑,或两者的结合。它基于带有源反转隐变量的统一动画控制机制,可编辑整个肖像,包括视觉驱动的形状控制、音频驱动的说话控制以及帧间时间控制。此外,通过调整初始参考帧,我们的方法可适应不同场景,实现对具有特定头部旋转和面部表情的肖像视频的精细编辑。这种综合方法为肖像视频编辑提供了全面且灵活的解决方案。实验结果表明,在唇部编辑任务中,我们的模型能够实现更准确、更同步的唇部运动,而在外观编辑任务中则能实现更灵活的运动迁移。演示页面详见 https://alice01010101.github.io/RASA/。
引用
@article{arxiv.2503.11571,
title = {RASA: Replace Anyone, Say Anything -- A Training-Free Framework for Audio-Driven and Universal Portrait Video Editing},
author = {Tianrui Pan and Lin Liu and Jie Liu and Xiaopeng Zhang and Jie Tang and Gangshan Wu and Qi Tian},
journal= {arXiv preprint arXiv:2503.11571},
year = {2025}
}
备注
Demo is available at https://alice01010101.github.io/RASA/