中文

LES-Talker:线性情绪空间中用于说话头生成的细粒度情绪编辑

计算机视觉与模式识别 2025-03-11 v2

摘要

尽管现有的单样本说话头生成模型在粗粒度情绪编辑方面取得了进展,但仍然缺乏具有高可解释性的细粒度情绪编辑模型。我们认为,一种方法若要被视为细粒度的,需要提供清晰的定义和足够详细的区分度。我们提出了LES-Talker,一种具有高可解释性的新型单样本说话头生成模型,以实现跨情绪类型、情绪级别和面部单元的细粒度情绪编辑。我们提出了基于面部动作单元的线性情绪空间定义,将情绪转换表征为向量变换。我们设计了跨维度注意力网络,以深入挖掘LES表示与3D模型表示之间的相关性。通过挖掘不同特征和结构维度之间的多重关系,我们使LES表示能够指导3D模型的可控变形。为了将存在偏差的多模态数据适配到LES并增强视觉质量,我们利用了专门的网络设计和训练策略。实验表明,我们的方法提供了高视觉质量以及多级别、可解释的细粒度情绪编辑,优于主流方法。

关键词

引用

@article{arxiv.2411.09268,
  title  = {LES-Talker: Fine-Grained Emotion Editing for Talking Head Generation in Linear Emotion Space},
  author = {Guanwen Feng and Zhihao Qian and Yunan Li and Siyu Jin and Qiguang Miao and Chi-Man Pun},
  journal= {arXiv preprint arXiv:2411.09268},
  year   = {2025}
}