中文

视觉-触觉融合对象聚类

机器学习 2019-11-22 v1 机器人学 机器学习

摘要

对象聚类旨在以无监督策略将相似对象归入同一簇,已在各类数据驱动应用中被广泛研究。然而,大多数现有最先进的对象聚类方法(例如单视图或多视图聚类方法)仅利用视觉信息,忽略了最重要的感知模态之一,即触觉信息——其有助于捕捉不同对象属性并进一步提升对象聚类任务性能。为有效利用视觉与触觉两种模态服务于对象聚类,本文提出一种深度类自动编码器的非负矩阵分解框架用于视觉-触觉融合聚类。具体而言,采用受欠完备类自动编码器架构约束的深度矩阵分解联合学习视觉-触觉融合数据的层次化表达,并保留视觉与触觉模态数据生成分布的局部结构。同时,引入图正则化器以捕捉各模态内数据样本的内在关系。此外,我们提出模态级一致性正则化器,以在公共子空间中有效对齐视觉与触觉数据,从而减小两者间的鸿沟。对于模型优化,我们给出一种高效的交替最小化策略来求解所提模型。最后,我们在公开数据集上进行了大量实验以验证框架的有效性。

关键词

引用

@article{arxiv.1911.09430,
  title  = {Visual Tactile Fusion Object Clustering},
  author = {Tao Zhang and Yang Cong and Gan Sun and Qianqian Wang and Zhenming Ding},
  journal= {arXiv preprint arXiv:1911.09430},
  year   = {2019}
}

备注

8 pages, 5 figures