基于残差融合 GAN 与特征匹配及感知损失的视觉-触觉跨模态数据生成
计算机视觉与模式识别
2021-07-13 v1 人工智能
机器人学
摘要
现有的心理物理学研究已揭示,跨模态的视觉-触觉感知对于执行日常活动的人类而言是普遍存在的。然而,建立从一种模态空间到另一种模态空间的算法映射,即跨模态视觉-触觉数据转换/生成,仍然具有挑战性,而这可能对机器人操作具有重要意义。本文中,我们提出了一种基于深度学习的方法,利用生成对抗网络(GANs)框架进行跨模态视觉-触觉数据生成。我们的方法以材料表面的视觉图像作为视觉数据,以笔在表面上滑动运动引起的加速度计信号作为触觉数据。我们采用条件 GAN(cGAN)结构以及残差融合(RF)模块,并利用额外的特征匹配(FM)和感知损失训练模型,以实现跨模态数据生成。实验结果表明,引入 RF 模块以及 FM 和感知损失,在生成数据的分类准确率和真实数据与生成数据之间的视觉相似性方面,显著提升了跨模态数据生成性能。
引用
@article{arxiv.2107.05468,
title = {Visual-Tactile Cross-Modal Data Generation using Residue-Fusion GAN with Feature-Matching and Perceptual Losses},
author = {Shaoyu Cai and Kening Zhu and Yuki Ban and Takuji Narumi},
journal= {arXiv preprint arXiv:2107.05468},
year = {2021}
}
备注
8 pages, 6 figures, Accepted by IEEE Robotics and Automation Letters