中文

VedicTHG:面向教育虚拟形象的低资源说话人脸生成的符号化吠陀计算

计算机视觉与模式识别 2026-02-10 v1 计算几何

摘要

说话人脸虚拟形象越来越多地被用于教育技术中,以提供具有社交临场感和更高参与度的内容。然而,许多最近的说话人脸生成(THG)方法依赖于以GPU为中心的神经渲染、大型训练集或高容量扩散模型,这限制了其在离线或资源受限的学习环境中的部署。本文描述了一个确定性的、面向CPU的THG框架,称为符号化吠陀计算,它将语音转换为时间对齐的音素流,将音素映射到紧凑的视位库,并通过受吠陀经句Urdhva Tiryakbhyam启发的符号化协同发音生成平滑的视位轨迹。一个轻量级的2D渲染器执行感兴趣区域(ROI)扭曲和嘴部合成并带有稳定功能,以支持在商用CPU上的实时合成。实验报告了在仅CPU执行下的同步精度、时间稳定性和身份一致性,并与具有代表性的CPU可行基线进行了比较。结果表明,在显著降低计算负载和延迟的同时,可以实现可接受的唇形同步质量,从而支持在低端硬件上实现实用的教育虚拟形象。GitHub: https://vineetkumarrakesh.github.io/vedicthg

关键词

引用

@article{arxiv.2602.08775,
  title  = {VedicTHG: Symbolic Vedic Computation for Low-Resource Talking-Head Generation in Educational Avatars},
  author = {Vineet Kumar Rakesh and Ahana Bhattacharjee and Soumya Mazumdar and Tapas Samanta and Hemendra Kumar Pandey and Amitabha Das and Sarbajit Pal},
  journal= {arXiv preprint arXiv:2602.08775},
  year   = {2026}
}