中文

ExpCLIP:通过语义对齐桥接文本与面部表情

计算机视觉与模式识别 2023-09-12 v2 人工智能

摘要

风格化语音驱动面部动画的目标是生成蕴含特定情感表达的动画。现有方法常依赖预设情感标签或面部表情模板,这可能限制准确传达用户意图所需的灵活性。本研究提出一种利用自然语言作为情感提示来控制任意风格的技术,在灵活性与易用性上均有优势。为实现该目标,我们首先构建文本-表情对齐数据集(TEAD),其中每个面部表情配有多条类提示描述。我们提出一种由大语言模型(LLM)支撑的创新自动标注方法以加速数据集构建,从而消除人工标注的巨大开销。随后,我们利用 TEAD 训练一个名为 ExpCLIP 的基于 CLIP 的模型,将文本与面部表情编码为语义对齐的风格嵌入。这些嵌入随后被整合进面部动画生成器,以产生富有表现力且可控的面部动画。鉴于现有语音驱动面部动画训练数据中面部情感多样性有限,我们进一步引入一种有效的表情提示增强(EPA)机制,使动画生成器支持前所未有的丰富风格控制。充分实验表明,我们的方法实现了富有表现力的面部动画生成,并在有效传达期望风格上提供了增强的灵活性。

关键词

引用

@article{arxiv.2308.14448,
  title  = {ExpCLIP: Bridging Text and Facial Expressions via Semantic Alignment},
  author = {Yicheng Zhong and Huawei Wei and Peiji Yang and Zhisheng Wang},
  journal= {arXiv preprint arXiv:2308.14448},
  year   = {2023}
}