VisualSpeaker:面向3D头像的视觉引导口唇合成
计算机视觉与模式识别
2025-07-22 v2 人工智能
摘要
逼真、高保真的3D面部动画对于人机交互和可访问性领域的表现丰富的头像系统至关重要。尽管先前方法显示出有前景的质量,但其对网格域的依赖限制了其完全利用2D计算机视觉和图形学中快速视觉创新的能力。我们提出VisualSpeaker,一种新型方法,通过光学逼真的可微分渲染,受视觉语音识别监督,以提高3D面部动画。我们的贡献是一种感知口语捕获损失,通过将光学逼真的3D高斯溅射头像渲染通过预训练的视觉自动语音识别模型于训练期间。针对MEAD数据集的评估表明,VisualSpeaker在标准Lip Vertex Error度量方面提高了56.1%,并提升了生成动画的感知质量,同时保留了网格驱动动画的可控性。这一感知焦点自然支持准确的口型,这是手语头像中消除相似手势的关键线索。
引用
@article{arxiv.2507.06060,
title = {VisualSpeaker: Visually-Guided 3D Avatar Lip Synthesis},
author = {Alexandre Symeonidis-Herzig and Özge Mercanoğlu Sincan and Richard Bowden},
journal= {arXiv preprint arXiv:2507.06060},
year = {2025}
}
备注
Accepted in International Conference on Computer Vision (ICCV) Workshops