中文

情感表达型儿童虚拟化身在训练应用中的多模态集成挑战

人机交互 2025-07-09 v2 计算机视觉与模式识别

摘要

动态面部表情对于可信的AI生成虚拟化身至关重要,但大多数系统仍保持视觉静态,限制了其在模拟中的应用,例如针对受虐儿童调查访谈的虚拟训练。我们提出了一种实时架构,将Unreal Engine 5 MetaHuman渲染与NVIDIA Omniverse Audio2Face相结合,以从语音韵律生成照片级真实感儿童虚拟面部的表情。由于TTS选项有限,两个虚拟化身均使用来自两个系统的年轻成年女性模型配音,以更好地匹配角色特征,从而引入了语音-年龄不匹配。这种混淆因素可能影响视听对齐。我们采用双PC设置,将语音生成与GPU密集型渲染解耦,从而在桌面和VR中实现低延迟交互。一项被试间研究(N=70)比较了音频+视觉与仅视觉条件,参与者对表达喜悦、悲伤和愤怒的虚拟化身的情感清晰度、面部真实感和共情能力进行评分。虽然情绪通常可以被识别——尤其是悲伤和喜悦——但在没有音频的情况下愤怒更难被察觉,这突显了语音在高唤醒度表达中的作用。有趣的是,静音片段通过去除语音与动画之间的不匹配(尤其在语调或年龄感觉不一致时)提升了感知真实感。这些结果强调了视听一致性的重要性:不匹配的语音会削弱表达,而良好的匹配可以增强较弱的视觉效果——这在敏感情境中对情感连贯的虚拟化身构成了挑战。

关键词

引用

@article{arxiv.2506.13477,
  title  = {Multimodal Integration Challenges in Emotionally Expressive Child Avatars for Training Applications},
  author = {Pegah Salehi and Sajad Amouei Sheshkal and Vajira Thambawita and Michael A. Riegler and Pål Halvorsen},
  journal= {arXiv preprint arXiv:2506.13477},
  year   = {2025}
}

备注

20 pages, 9 figures, 9 tables