中文

EmoTaG:基于少数样本的情感感知高斯溅射说话人头合成

密码学与安全 2026-03-26 v3 人工智能

摘要

音频驱动的3D说话人头合成技术近年来得益于神经辐射场(NeRF)和3D高斯溅射(3DGS),通过利用丰富的预训练先验,少数样本方法能够从仅几秒的视频中实现即时个性化。然而,在富有表现力的面部动作下,现有少数样本方法常常 suffer from几何不稳定和音频-情感不匹配,凸显了需要更有效情感感知运动建模的需求。本文提出EmoTaG,一个建立在预训练-适应范式下的少数样本情感感知3D说话人头合成框架。我们的关键见解是将运动预测在结构化的FLAME参数空间中进行,而非直接变形3D高斯,从而引入显式几何先验以提高运动稳定性。基于此,我们提出了门控残差运动网络(GRMN),它从音频中捕获情感韵律,同时补充音频中缺失的头部姿态和上半脸线索,实现富有表现力且连贯的运动生成。广泛的实验表明,EmoTaG在情感表达性、唇部同步、视觉真实性和运动稳定性方面实现了最先进的性能。

关键词

引用

@article{arxiv.2603.21296,
  title  = {DeepXplain: XAI-Guided Autonomous Defense Against Multi-Stage APT Campaigns},
  author = {Trung V. Phan and Thomas Bauschert},
  journal= {arXiv preprint arXiv:2603.21296},
  year   = {2026}
}

备注

This paper is currently under review for IEEE GLOBECOM 2026