身份即存在:面向面部外观与声纹个性化联合音视频生成
计算机视觉与模式识别
2026-03-26 v3
摘要
近期进展表明具有 compelling 能力于合成真实个体至生成视频,反映日益增长对身份感知内容创建的需求。然而,尚无开放可访问框架可实现对面部外观与声纹在多身份间的细粒度控制。本文提出统一且可扩展的身份感知联合音视频生成框架,实现高保真且一致的个性化。具体而言,我们引入数据 curated pipeline,自动提取跨音视频模态的身份信息,覆盖从单主体至多主体互动的多种场景。我们进一步提出面向单主体与多主体情景的灵活且可扩展的身份注入机制,其中面部外观与声学质感作为身份携带控制信号。鉴于模态差异,我们设计多阶段训练策略以加速收敛并确保跨模态一致性。实验表明所提框架具有优势。欲获取更多细节及定性结果,请参阅我们的网页:\href{https://chen-yingjie.github.io/projects/Identity-as-Presence}{Identity-as-Presence}。
引用
@article{arxiv.2603.17889,
title = {Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation},
author = {Yingjie Chen and Shilun Lin and Cai Xing and Binxin Yang and Long Zhou and Qixin Yan and Wenjing Wang and Dingming Liu and Hao Liu and Chen Li and Jing Lyu},
journal= {arXiv preprint arXiv:2603.17889},
year = {2026}
}