中文

阐明多目标表示学习中目标分割机制的消融研究

计算机视觉与模式识别 2023-10-06 v1 机器学习 图像与视频处理

摘要

多目标表示学习旨在利用多个目标的组合来表示复杂的真实世界视觉输入。表示学习方法常采用无监督学习将输入图像分割为单个目标,并将这些目标编码至各自潜向量中。然而,先前方法如何实现恰当的单目标分割尚不清楚。此外,多数先前方法使用变分自编码器(VAE)对潜向量进行正则化。因此,VAE 正则化是否有助于恰当的目标分割亦不明确。为阐明多目标表示学习中的目标分割机制,我们对典型方法 MONet 进行了消融研究。MONet 使用由注意力掩码及对应潜向量组成的配对表示多个目标。每个潜向量由输入图像与注意力掩码编码得到。随后,由每个潜向量解码出分量图像与注意力掩码。MONet 的损失函数包括:1)输入图像与解码分量图像间重建损失之和,2)潜向量的 VAE 正则化损失,3)注意力掩码的重建损失以显式编码形状信息。我们对这三个损失函数进行消融研究以考察其对分割性能的影响。结果表明,VAE 正则化损失不影响分割性能,而其他损失会影响。基于此结果,我们假设最大化由对应注意力掩码的单潜向量最佳表示的图像区域的注意力掩码至关重要。我们通过评估具有与该假设相同机制的新损失函数验证了此假设。

关键词

引用

@article{arxiv.2310.03273,
  title  = {Ablation Study to Clarify the Mechanism of Object Segmentation in Multi-Object Representation Learning},
  author = {Takayuki Komatsu and Yoshiyuki Ohmura and Yasuo Kuniyoshi},
  journal= {arXiv preprint arXiv:2310.03273},
  year   = {2023}
}