面向通用指涉分割的短语-实例对齐
图像与视频处理
2024-11-25 v1 计算机视觉与模式识别
量子物理
摘要
通用指涉表达式可以描述一个对象、几个相关对象或一个对象都不描述。现有的通用指涉分割(GRES)模型将所有情况统一处理,预测单个二元掩码,忽略了语言短语如何对应于 distinct visual instances。为此,我们将 GRES 重新表述为实例级别的推理问题,模型首先预测以指涉表达式为条件的多个实例感知对象查询,然后将每个查询与其最相关的短语对齐。这种对齐通过构建语言短语与视觉实例之间细粒度对应关系的 Phrase-Object Alignment(POA)损失来实现。给定这些对齐的对象实例查询及其学习到的相关性得分,最终的分割以及无目标情况都通过统一的相关性加权聚合机制推断。这种实例感知的表述使得可以实现明确的短语-实例 grounding、可解释的推理以及对复杂或空表达式的稳健处理。在 gRefCOCO 和 Ref-ZOM 数据集上的大量实验表明,我们的方法通过3.22%的 cIoU 和12.25%的 N-acc显著推动了最先进技术的性能。
引用
@article{arxiv.2411.15086,
title = {Quantum-enhanced unsupervised image segmentation for medical images analysis},
author = {Laia Domingo and Mahdi Chehimi},
journal= {arXiv preprint arXiv:2411.15086},
year = {2024}
}
备注
16 pages, 7 figures