中文

Parts2Words:通过部件与单词的双向匹配学习点云与文本的联合嵌入

计算机视觉与模式识别 2023-04-04 v2

摘要

形状-文本匹配是高级形状理解的一项重要任务。现有方法主要将3D形状表示为多个2D渲染视图,由于有限视图数量下自遮挡引起的结构歧义,这显然不能被很好地理解。为解决此问题,我们直接将3D形状表示为点云,并提出通过形状部件与文本单词之间的双向匹配来学习点云与文本的联合嵌入。具体而言,我们首先将点点云分割为部件,然后利用最优传输方法在优化特征空间中匹配部件与单词,其中每个部件通过聚合其内部所有点的特征来表示,每个单词由其上下文信息抽象表示。我们优化特征空间以增大配对训练样本之间的相似性,同时最大化非配对样本之间的间隔。实验表明,在Text2Shape数据集下的多模态检索任务中,我们的方法在准确率上比SOTA方法取得了显著提升。代码可在 https://github.com/JLUtangchuan/Parts2Words 获取。

关键词

引用

@article{arxiv.2107.01872,
  title  = {Parts2Words: Learning Joint Embedding of Point Clouds and Texts by Bidirectional Matching between Parts and Words},
  author = {Chuan Tang and Xi Yang and Bojian Wu and Zhizhong Han and Yi Chang},
  journal= {arXiv preprint arXiv:2107.01872},
  year   = {2023}
}