FixTalk:针对极端情况下的高质量说话人头图像生成驯化身份泄漏
计算机视觉与模式识别
2025-07-03 v1
摘要
说话人头图像生成正逐渐成为各领域的重要应用,人们对高质量渲染提出日益增长的需求。然而,现有方法在极端情况下常常出现身份泄漏(IL)和渲染缺陷(RA)。通过对先前方法的深入分析,我们确定了两个关键洞察:(1) IL源于身份信息嵌入在运动特征中;(2)这种身份信息可被用于解决RA问题。基于这些发现,本文引入FixTalk,一种旨在同时解决这两个问题以实现高质量说话人头生成的新型框架。首先,我们提出增强型运动指示器(EMI),有效地从运动特征中解耦身份信息,从而减轻身份泄漏对生成说话人头的影响。为解决RA,我们引入增强型细节指示器(EDI),利用泄漏的身份信息来补充缺失的细节,从而修复缺陷。广泛的实验表明,FixTalk有效缓解了IL和RA,相较于最先进的方法实现了卓越的性能。
引用
@article{arxiv.2507.01390,
title = {FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases},
author = {Shuai Tan and Bill Gong and Bin Ji and Ye Pan},
journal= {arXiv preprint arXiv:2507.01390},
year = {2025}
}