中文

检索增强高斯头像:提升表情泛化能力

计算机视觉与模式识别 2026-03-10 v1 图形学 机器学习

摘要

模板无关可动画头部头像可通过直接从单一主体的捕获数据中学习表情依赖的面部变形来实现高视觉保真度,避免使用参数化面部模板和手工设计的混合形状空间。然而,由于所学变形仅由单个身份所观察到的表情监督,这些模型面临表情覆盖范围有限的问题,常在驱动偏离训练分布的运动时表现不佳。我们提出 RAF(Retrieval-Augmented Faces),一种为模板无关头部头像设计的简单训练时增强方法。RAF 构建大型无标签表情库,在训练期间,用该库中检索到的最近邻表情替换主体表情特征的子集,同时仍重构主体原始帧。这将变形场暴露于更广泛的表情条件,鼓励更强的身份-表情解耦,提高对表情分布偏移的鲁棒性,而无需配对跨身份数据、额外标注或架构修改。我们进一步分析检索增强如何增加表情多样性,并通过用户研究验证检索结果在表情和姿态上的感知接近性。NeRSemble 数据集基准实验表明,RAF 在自驱动和跨驱动场景中均显著优于基线方法,提升了表情保真度。

关键词

引用

@article{arxiv.2603.08645,
  title  = {Retrieval-Augmented Gaussian Avatars: Improving Expression Generalization},
  author = {Matan Levy and Gavriel Habib and Issar Tzachor and Dvir Samuel and Rami Ben-Ari and Nir Darshan and Or Litany and Dani Lischinski},
  journal= {arXiv preprint arXiv:2603.08645},
  year   = {2026}
}