中文

TranSTYLer:用于面部与身体姿态生成的多模态行为风格迁移

多媒体 2023-08-22 v1 计算机视觉与模式识别 机器学习 声音 音频与语音处理

摘要

本文解决了将虚拟智能体的行为表现风格迁移到另一个智能体同时保留行为形状(因其承载交际意义)的挑战。此处行为表现风格被视为行为的定性属性。我们提出TranSTYLer,一种基于多模态Transformer的模型,该模型以目标说话人的风格合成源说话人的多模态行为。我们假设行为表现风格编码于包括文本、语音、身体姿态和面部表情在内的各种交际模态中。该模型采用风格与内容解耦方案,以确保迁移的风格不干扰源行为所传达的含义。我们的方法无需风格标签,并允许对训练阶段未见的风格进行泛化。我们在PATS语料库上训练模型,该语料库被扩展以包含对话行为和2D面部标志点。客观与主观评估表明,我们的模型在训练期间所见和未见风格的风格迁移上均优于SOTA模型。为解决可能出现的风格与内容泄漏问题,我们提出一种方法论来评估与目标风格相关的行为和姿态成功迁移的程度,同时确保与源内容相关者得以保留。

关键词

引用

@article{arxiv.2308.10843,
  title  = {TranSTYLer: Multimodal Behavioral Style Transfer for Facial and Body Gestures Generation},
  author = {Mireille Fares and Catherine Pelachaud and Nicolas Obin},
  journal= {arXiv preprint arXiv:2308.10843},
  year   = {2023}
}