中文

EditYourself:基于扩散转换器的音频驱动化谈头视频生成与编辑

计算机视觉与模式识别 2026-01-30 v1 图形学 机器学习 多媒体

摘要

当前生成式视频模型在从文本和图像提示生成新内容方面表现优异,但在编辑预先录制的视频方面仍存在关键缺口。当需要对已录制的谈话视频进行脚本微调时,必须保持运动、时间连贯性、说话人身份识别以及准确的唇部同步。我们引入 EditYourself,一个基于 DiT 的框架,用于音频驱动的视频到视频(V2V)编辑,使其能够实现基于转录脚本的谈话头视频修改,包括无缝添加、删除和重新时间轴处理视觉上语言内容。基于通用视频扩散模型,EditYourself 通过音频条件化和区域感知、以编辑为导向的训练扩展增强了其 V2V 能力。这使得通过时空 inpainting 实现精确的唇部同步和时序连贯的表演重构,包括在新添加片段中合成逼真的人体动作,同时保持长时间尺度上的视觉保真度和身份一致性。这一工作代表了将生成式视频模型作为专业视频后期生产工具的基础性步骤。

关键词

引用

@article{arxiv.2601.22127,
  title  = {EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers},
  author = {John Flynn and Wolfgang Paier and Dimitar Dinev and Sam Nhut Nguyen and Hayk Poghosyan and Manuel Toribio and Sandipan Banerjee and Guy Gafni},
  journal= {arXiv preprint arXiv:2601.22127},
  year   = {2026}
}

备注

Project page: https://edit-yourself.github.io/