面对现实:双人对话中考虑对话者的概率多模态面部姿态生成
计算机视觉与模式识别
2020-10-26 v2 人机交互
机器学习
声音
音频与语音处理
图像与视频处理
机器学习
摘要
为了实现更自然的面对面交互,对话代理需要使其行为适应对话者。其中一个关键方面是为代理生成恰当的非言语行为,例如面部姿态,此处定义为面部表情和头部运动。大多数现有姿态生成系统综合非言语行为时未利用来自对话者的多模态线索。那些利用的系统通常采用确定性方法,可能产生重复且不生动的动作。本文引入一种概率方法,用于在双人对话中合成考虑对话者的面部姿态——由极具表现力的 FLAME 参数表示。我们的贡献为:a) 一种从多方视频和语音记录中提取特征的方法,产生一种表示,可在 3D 虚拟形象中独立控制和操纵表情与语音发音;b) 对近期基于归一化流的姿态合成方法 MoGlow 的扩展,以将对话者的多模态信号作为输入并随后输出考虑对话者的面部姿态;c) 一项评估输入模态使用及其相对重要性的主观评价。结果表明,模型成功利用对话者输入生成更恰当的行为。视频、数据和代码见:https://jonepatr.github.io/lets_face_it。
引用
@article{arxiv.2006.09888,
title = {Let's Face It: Probabilistic Multi-modal Interlocutor-aware Generation of Facial Gestures in Dyadic Settings},
author = {Patrik Jonell and Taras Kucherenko and Gustav Eje Henter and Jonas Beskow},
journal= {arXiv preprint arXiv:2006.09888},
year = {2020}
}
备注
Best Paper Award. 8 pages, 4 figures, IVA '20: Proceedings of the 20th ACM International Conference on Intelligent Virtual Agent