中文

用于操作指令中物体分割的多模态扩散分割模型

计算机视觉与模式识别 2023-07-18 v1 计算与语言 机器人学

摘要

在本研究中,我们旨在开发一个模型,其能理解自然语言指令(例如“去客厅并取走墙上收音机艺术品旁最近的枕头”)并为目标日常物体生成分割掩码。该任务具有挑战性,因为它需要(1)理解指令中多个物体的指代表达,(2)在多个短语中预测句子的目标短语,以及(3)生成像素级分割掩码而非边界框。已有基于语言的分割方法的研究;然而,对于复杂句子它们有时会掩蔽不相关区域。本文中,我们提出多模态扩散分割模型(MDSM),其第一阶段生成掩码并在第二阶段精炼之。我们引入了跨模态并行特征提取机制,并扩展扩散概率模型以处理跨模态特征。为验证我们的模型,我们基于知名的 Matterport3D 与 REVERIE 数据集构建了一个新数据集。该数据集由带复杂指代表达的指令及展现各类目标物体的真实室内环境图像,连同像素级分割掩码组成。MDSM 的性能大幅超越基线方法,mean IoU 提升 +10.13。

关键词

引用

@article{arxiv.2307.08597,
  title  = {Multimodal Diffusion Segmentation Model for Object Segmentation from Manipulation Instructions},
  author = {Yui Iioka and Yu Yoshida and Yuiga Wada and Shumpei Hatanaka and Komei Sugiura},
  journal= {arXiv preprint arXiv:2307.08597},
  year   = {2023}
}

备注

Accepted for presentation at IROS2023