Text2Action:从语言到动作的生成对抗合成
机器学习
2017-10-25 v2 计算与语言
机器人学
摘要
在本文中,我们提出了一种生成模型,该模型学习语言与人类动作之间的关系,以便在给定描述人类行为的句子时生成人类动作序列。所提出的生成模型是基于序列到序列(SEQ2SEQ)模型的生成对抗网络(GAN)。利用所提出的生成网络,我们可以使用文本编码器循环神经网络(RNN)和动作解码器 RNN 来为机器人或虚拟智能体合成各种动作。所提出的生成网络使用从大规模视频数据集 MSR-Video-to-Text (MSR-VTT) 中提取的 29,770 对动作与句子标注进行训练。我们证明了该网络能够生成可迁移至 Baxter 机器人的类人动作,使得该机器人能够根据提供的句子执行动作。结果表明,所提出的生成网络正确地建模了语言与动作之间的关系,并且能够从同一个句子生成多种不同的动作。
引用
@article{arxiv.1710.05298,
title = {Text2Action: Generative Adversarial Synthesis from Language to Action},
author = {Hyemin Ahn and Timothy Ha and Yunho Choi and Hwiyeon Yoo and Songhwai Oh},
journal= {arXiv preprint arXiv:1710.05298},
year = {2017}
}
备注
8 pages, 10 figures