中文

半监督全景叙事定位

计算机视觉与模式识别 2023-10-30 v1

摘要

尽管取得了显著进展,全景叙事定位(PNG)的发展仍受限于昂贵的标注。在本文中,我们引入了一种新颖的半监督全景叙事定位(SS-PNG)学习方案,利用较小规模的标注图像-文本对和较大规模的未标注对来实现具有竞争力的性能。与视觉分割任务不同,PNG 涉及一个像素属于多个开放式名词。因此,现有的基于多类的半监督分割框架无法直接应用于该任务。为应对这一挑战,我们首先开发了专为 SS-PNG 设置定制的新颖 SS-PNG 网络(SS-PNG-NW)。我们深入研究了 Burn-In 和数据增强等策略,以确定 SS-PNG-NW 的最优通用配置。此外,为解决伪标签质量不平衡的问题,我们提出了一种基于质量的损失调整(QLA)方法来调整半监督目标,从而增强了 SS-PNG-NW+。采用我们提出的 QLA,我们分别改进了像素级和掩码级的 BCE Loss 和 Dice loss。我们在 PNG 数据集上进行了大量实验,我们的 SS-PNG-NW+ 在所有数据比例下均展现出与全监督模型相当的有前景结果。值得注意的是,我们的 SS-PNG-NW+ 仅使用 30% 和 50% 的监督数据便超越了全监督模型,分别超出其性能 0.8% 和 1.1%。这凸显了我们提出的 SS-PNG-NW+ 在克服有限标注带来的挑战以及增强 PNG 任务适用性方面的有效性。源代码见 https://github.com/nini0919/SSPNG。

关键词

引用

@article{arxiv.2310.18142,
  title  = {Semi-Supervised Panoptic Narrative Grounding},
  author = {Danni Yang and Jiayi Ji and Xiaoshuai Sun and Haowei Wang and Yinan Li and Yiwei Ma and Rongrong Ji},
  journal= {arXiv preprint arXiv:2310.18142},
  year   = {2023}
}

备注

ACM MM 2023