中文

迈向更逼真的人机对话:一种基于 Seq2Seq 的肢体手势交互系统

计算机视觉与模式识别 2019-11-18 v3

摘要

本文提出一种新颖的系统,使智能机器人在与人交流时展现出逼真的肢体手势。所提系统由在相应对话阶段使用的倾听模型和说话模型组成。两个模型均由 sequence-to-sequence (seq2seq) 架构改编而来,以合成由十二个上半身关键点运动表示的手势。所有提取的 2D 关键点首先进行 3D 变换,然后旋转并归一化以丢弃无关信息。我们从 Youtube 收集并预处理大量人类对话视频,分别训练倾听和说话模型,之后使用测试集上的均方误差(MSE)和余弦相似度指标对两个模型进行评估。调优后的系统被实现用于驱动一个虚拟化身以及物理人形机器人 Pepper,以展示我们的方法在对话交互能力上的实际提升。

关键词

引用

@article{arxiv.1905.01641,
  title  = {Towards More Realistic Human-Robot Conversation: A Seq2Seq-based Body Gesture Interaction System},
  author = {Minjie Hua and Fuyuan Shi and Yibing Nan and Kai Wang and Hao Chen and Shiguo Lian},
  journal= {arXiv preprint arXiv:1905.01641},
  year   = {2019}
}

备注

Accepted by IROS 2019. Slides: https://youtu.be/zOp6tT_etQE