中文

反应还是不反应:双人对话中个性化虚拟形象端到端视觉姿态预测

计算机视觉与模式识别 2019-10-08 v1 人工智能

摘要

手势、面部表情、身体姿态和副语言线索等非言语行为已被证明能够补充或澄清言语信息。因此,为了以虚拟形象形式改进远程呈现,建模这些行为尤为重要,尤其在双人交互中。创建此类个性化虚拟形象不仅需要建模虚拟形象语音与其身体姿态之间的个人内动态,还需建模与对话中对话者的个人间动态。本文中,我们引入一种名为双人残差注意力模型(DRAM)的神经网络架构,它利用选择性注意力整合个人内(单子)与个人间(双子)动态,以对话者音频与身体姿态以及操控虚拟形象之人的音频为条件生成身体姿态序列。我们在包含双方参与者姿态与音频的双人对话数据上评估所提模型,证实了在预测虚拟形象姿态时单子与双子动态间自适应注意力的重要性。我们还进行了用户研究以分析人类观察者的判断。结果证实,生成的身体姿态比非自适应单子/双子模型更自然,且更好地建模了个人内与个人间动态。

关键词

引用

@article{arxiv.1910.02181,
  title  = {To React or not to React: End-to-End Visual Pose Forecasting for Personalized Avatar during Dyadic Conversations},
  author = {Chaitanya Ahuja and Shugao Ma and Louis-Philippe Morency and Yaser Sheikh},
  journal= {arXiv preprint arXiv:1910.02181},
  year   = {2019}
}