基于风格迁移的语音与音视觉场景理解:从视频中获取机器人动作序列
计算与语言
2023-06-28 v1
摘要
为实现人机协作,机器人需要根据人类指令,在有限先验知识下执行新任务的操作。人类专家可通过演示中的多模态指令与机器人分享如何完成任务的知识,展示一系列短时步骤以达成长时目标。本文提出一种从指令视频生成机器人动作序列的方法,使用(1)一个音视觉 Transformer,将音视觉特征与指令语音转换为称为动态运动基元(DMPs)的机器人动作序列;(2)基于风格迁移的训练,采用视频字幕的多任务学习与语义分类器的弱监督学习来利用未配对视频-动作数据。我们构建了一个完成多种烹饪动作的系统,其中机械臂机器人使用音视觉 Transformer 从烹饪视频中获取 DMP 序列并执行。在 Epic-Kitchen-100、YouCookII、QuerYD 及内部指令视频数据集上的实验表明,所提方法将 DMP 序列质量提升至基线视频到动作 Transformer 所得 METEOR 分数的 2.3 倍。该模型在具备物体任务知识的情况下达到了 32% 的任务成功率。
引用
@article{arxiv.2306.15644,
title = {Style-transfer based Speech and Audio-visual Scene Understanding for Robot Action Sequence Acquisition from Videos},
author = {Chiori Hori and Puyuan Peng and David Harwath and Xinyu Liu and Kei Ota and Siddarth Jain and Radu Corcodel and Devesh Jha and Diego Romeres and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2306.15644},
year = {2023}
}
备注
Accepted to Interspeech2023