中文

Text2Action:从语言到动作的生成对抗合成

机器学习 2017-10-25 v2 计算与语言 机器人学

摘要

在本文中,我们提出了一种生成模型,该模型学习语言与人类动作之间的关系,以便在给定描述人类行为的句子时生成人类动作序列。所提出的生成模型是基于序列到序列(SEQ2SEQ)模型的生成对抗网络(GAN)。利用所提出的生成网络,我们可以使用文本编码器循环神经网络(RNN)和动作解码器 RNN 来为机器人或虚拟智能体合成各种动作。所提出的生成网络使用从大规模视频数据集 MSR-Video-to-Text (MSR-VTT) 中提取的 29,770 对动作与句子标注进行训练。我们证明了该网络能够生成可迁移至 Baxter 机器人的类人动作,使得该机器人能够根据提供的句子执行动作。结果表明,所提出的生成网络正确地建模了语言与动作之间的关系,并且能够从同一个句子生成多种不同的动作。

关键词

引用

@article{arxiv.1710.05298,
  title  = {Text2Action: Generative Adversarial Synthesis from Language to Action},
  author = {Hyemin Ahn and Timothy Ha and Yunho Choi and Hwiyeon Yoo and Songhwai Oh},
  journal= {arXiv preprint arXiv:1710.05298},
  year   = {2017}
}

备注

8 pages, 10 figures