基于相邻帧先验的谈话头模型探索:语音保留 facial expression manipulation
计算机视觉与模式识别
2026-01-21 v1
摘要
语音保留面部表情操控(Speech-Preserving Facial Expression Manipulation, SPFEM)是一种旨在图像和视频中保留原始嘴部动作的创新技术,用于改变面部表情。尽管取得了进展,SPFEM仍在面部表情与嘴部形状之间的复杂相互作用中难以实现准确的唇部同步。利用语音驱动谈话头生成(Audio-Driven Talking Head Generation, AD-THG)模型在合成精确唇部动作方面的先进能力,我们的研究引入了将这些模型与SPFEM集成的新方法。我们提出了一种新框架,称为谈话头面部表情操控(Talking Head Facial Expression Manipulation, THFEM),该框架利用AD-THG模型从音频输入生成准确同步唇部动作的帧,并对SPFEM处理后的图像进行表情操控。然而,增加AD-THG模型生成的帧数会损害图像的真实性和表情保真度。为此,我们开发了相邻帧学习策略,对AD-THG模型进行微调,以预测连续帧序列。该策略使模型能够整合相邻帧的信息,显著提高测试期间的图像质量。我们的广泛实验评估表明,该框架在表情操控过程中有效保留了嘴部形状,突显了将AD-THG与SPFEM集成的显著优势。
引用
@article{arxiv.2601.12876,
title = {Exploring Talking Head Models With Adjacent Frame Prior for Speech-Preserving Facial Expression Manipulation},
author = {Zhenxuan Lu and Zhihua Xu and Zhijing Yang and Feng Gao and Yongyi Lu and Keze Wang and Tianshui Chen},
journal= {arXiv preprint arXiv:2601.12876},
year = {2026}
}
备注
Accepted by ACM Transactions on Multimedia Computing, Communications, and Applications