面向基于语言落地的实用跨模态流形对齐
计算机视觉与模式识别
2020-09-14 v1 机器学习
机器人学
机器学习
摘要
我们提出一种跨模态流形对齐方法,利用三元组损失联合学习真实世界物品基于语言的概念的一致多模态嵌入。我们的方法通过从 RGB-深度图像及其自然语言描述中采样锚点、正样本和负样本数据点来学习这些嵌入。我们表明,与某些需要后处理步骤(如 Procrustes 分析)才能取得合理性能的基线方法不同,我们的方法可以受益于但不需要此类后处理步骤。我们在两个常用于开发基于机器人的落地语言学习系统的数据集上展示了我们方法的有效性,在五个评估指标上我们的方法优于包括一种最先进方法在内的四种基线。
引用
@article{arxiv.2009.05147,
title = {Practical Cross-modal Manifold Alignment for Grounded Language},
author = {Andre T. Nguyen and Luke E. Richards and Gaoussou Youssouf Kebe and Edward Raff and Kasra Darvish and Frank Ferraro and Cynthia Matuszek},
journal= {arXiv preprint arXiv:2009.05147},
year = {2020}
}