当单词微笑:从文本生成多样情感面部表情
人工智能
2025-10-21 v4 计算机视觉与模式识别
摘要
使数字人能够表达丰富的情感在对话系统、游戏和其他交互场景中具有重要应用价值。虽然最近的说话头发型合成技术在唇同步方面取得了令人印象深刻的成果,但它们倾向于忽视面部表情的丰富性和动态性。为填补这一关键缺口,我们引入了一个专注于情感动态的端到端文本到表情模型。我们的模型在连续潜在空间中学习表情的变异性,并生成多样、流畅且情感连贯的表情。为了支持这一任务,我们引入了 EmoAva,一个包含 15,000 个文本-3D 表情对的大规模高质量数据集。在现有数据集和 EmoAva 上的大量实验表明,我们的方法在多个评估指标上显著优于基线方法,为该领域带来了重要进展。
引用
@article{arxiv.2412.02508,
title = {When Words Smile: Generating Diverse Emotional Facial Expressions from Text},
author = {Haidong Xu and Meishan Zhang and Hao Ju and Zhedong Zheng and Erik Cambria and Min Zhang and Hao Fei},
journal= {arXiv preprint arXiv:2412.02508},
year = {2025}
}
备注
Accepted by EMNLP 2025 (Oral); Project Page: https://walkermitty.github.io/EmoAva