中文

评估说话人脸生成中的身份泄露:指标与评估框架

计算机视觉与模式识别 2026-02-11 v2 图像与视频处理

摘要

基于视频编辑的说话人脸生成旨在保留姿态、光照和手势等视频细节,仅修改唇部动作,常需使用身份参考图像维持说话人一致性。然而,这种机制可能引入唇部泄露,即生成的唇部受参考图像影响,而非仅由驱动音频决定。此类泄露难以通过标准指标和常规测试 setup 检测到。为此,我们提出了系统化的评估方法论,用于分析和量化唇部泄露。该框架采用三种互补测试 setup:静音输入生成、错位音视频配对以及匹配音视频合成。我们还引入了派生指标,包括唇同步偏差和基于静音音频的唇同步分数。此外,我们研究了不同的身份参考选择如何影响泄露,为参考设计提供了洞察。该方法论具有模型无关性,为未来说话人脸生成研究建立了更可靠的基准。

关键词

引用

@article{arxiv.2511.08613,
  title  = {Assessing Identity Leakage in Talking Face Generation: Metrics and Evaluation Framework},
  author = {Dogucan Yaman and Fevziye Irem Eyiokur and Hazım Kemal Ekenel and Alexander Waibel},
  journal= {arXiv preprint arXiv:2511.08613},
  year   = {2026}
}

备注

Accepted to ICASSP 2026