中文

OSM-Net:具有自发头部运动的一对多多样本说话头生成

计算机视觉与模式识别 2023-09-29 v1

摘要

单样本说话头生成没有显式的头部运动参考,因此难以生成具有头部运动的说话头。一些现有工作仅编辑嘴部区域并生成静止说话头,导致不真实的说话头表现。其他工作构建音频信号与头部运动序列之间的一对一映射,由于人们在说相同内容时头部运动表现可能不同,这种映射引入了模糊对应。这种不合理的映射形式未能建模多样性,并产生近乎静止甚至夸张的头部运动,显得不自然且奇怪。因此,单样本说话头生成任务实际上是一个一对多的病态问题,人们在说话时呈现多样的头部运动。基于上述观察,我们提出OSM-Net,一种具有自然头部运动的“一对多”单样本说话头生成网络。OSM-Net构建了一个包含丰富多样片段级头部运动特征的运动空间。该空间的每个基表示一段片段中有意义的头部运动特征而非仅一帧,从而提供更具连贯性与自然性的说话头运动变化。驱动音频被映射至运动空间,在其周围合理范围内可采样多种运动特征以实现一对多映射。此外, landmark约束与时间窗特征输入改善了准确的表情特征提取与视频生成。大量实验表明,与其他方法相比,OSM-Net在合理的一对多映射范式下生成更自然真实的头部运动。

关键词

引用

@article{arxiv.2309.16148,
  title  = {OSM-Net: One-to-Many One-shot Talking Head Generation with Spontaneous Head Motions},
  author = {Jin Liu and Xi Wang and Xiaomeng Fu and Yesheng Chai and Cai Yu and Jiao Dai and Jizhong Han},
  journal= {arXiv preprint arXiv:2309.16148},
  year   = {2023}
}

备注

Paper Under Review