中文

FLOAT:用于改进多对象多部件场景解析的对象属性分解学习

计算机视觉与模式识别 2022-03-31 v1

摘要

多对象多部件场景解析是一项具有挑战性的任务,需要在场景中检测多个对象类别并分割每个对象内的语义部件。本文中,我们提出FLOAT,一种用于可扩展多对象多部件解析的分解标签空间框架。我们的框架涉及对象类别与部件属性的独立密集预测,与整体式标签空间对应方法相比,提高了可扩展性并降低了任务复杂度。此外,我们提出一种推理时“缩放”细化技术,显著提升了分割质量,尤其针对较小的对象/部件。与最先进水平相比,FLOAT在Pascal-Part-58数据集上mean IOU(mIOU)绝对提升2.0%,分割质量IOU(sqIOU)绝对提升4.8%。对于更大的Pascal-Part-108数据集,mIOU提升2.1%,sqIOU提升3.9%。我们纳入先前排除的部件属性及Pascal-Part数据集的其他次要部件,创建了最全面且最具挑战性的版本,称之为Pascal-Part-201。FLOAT在新数据集上mIOU提升8.6%,sqIOU提升7.5%,展示了其在具有挑战性的多样化对象与部件上的解析有效性。代码与数据集可在 floatseg.github.io 获取。

关键词

引用

@article{arxiv.2203.16168,
  title  = {FLOAT: Factorized Learning of Object Attributes for Improved Multi-object Multi-part Scene Parsing},
  author = {Rishubh Singh and Pranav Gupta and Pradeep Shenoy and Ravikiran Sarvadevabhatla},
  journal= {arXiv preprint arXiv:2203.16168},
  year   = {2022}
}

备注

Accepted at CVPR 2022. Project Page : https://floatseg.github.io/