中文

ISExplore:面向高效个性化3D说话人面部生成的信息化分段选择

计算机视觉与模式识别 2026-04-28 v2

摘要

基于神经辐射场(NeRF)和3D高斯溅射(3DGS)的说话人面部生成(TFG)方法最近在个性化说话人合成方面取得了显著进展。然而,现有方法通常需要几分钟的参考视频进行细致的预处理和拟合,导致准备时间延长至数小时,限制了实际应用。本文重访一个基本却鲜有人探索的问题:高质量的个性化TFG模型真的需要几分钟长的参考视频?我们的探索性研究揭示,仅挑选几秒的精选参考片段,往往即可实现与使用完整参考视频相当的性能。这一发现表明,参考数据的信息性比其时长更为关键。针对这一观察,我们提出ISExplore(Informative Segment Explore),一种简单而有效的分段选择策略,通过三个关键数据质量维度自动识别最具信息性的短参考片段:音频特征多样性、唇部运动幅度和视点多样性。大量实验表明,ISExplore可为NeRF和3DGS方法的参考数据处理和训练时间缩短50%以上,同时保持高保真生成质量。我们的方法为个性化TFG提供了实用且高效的解决方案,也为3D说话人面部生成中的数据效率提供了新视角。

关键词

引用

@article{arxiv.2511.07940,
  title  = {ISExplore:Informative Segment Selection for Efficient Personalized 3D Talking Face Generation},
  author = {Rui-Qing Sun and Ang Li and Zhijing Wu and Tian Lan and Qianyu Lu and Xingshan Yao and Chen Xu and Xian-Ling Mao},
  journal= {arXiv preprint arXiv:2511.07940},
  year   = {2026}
}