Finding NeMo:面向指代图像分割的负样本挖掘马赛克增强
计算机视觉与模式识别
2024-11-05 v1
摘要
指代图像分割是一项从图像中分割出由文本查询所指代对象的综合性任务。在自然状态下,该任务的难度受到相似对象存在和指代表达式复杂性的影响。近期的RIS模型在简单和困难场景之间仍表现出显著的性能差距。我们认为瓶颈存在于数据中,并提出了一种简单而强大的数据增强方法——负样本挖掘马赛克增强(NeMo)。该方法将训练图像增强为由预训练多模态对齐模型(如CLIP)精心筛选的三个负样本图像组成的马赛克,从而使样本更具挑战性。我们发现正确调整难度水平至关重要,既不能太模糊也不能太简单。增强后的训练数据鼓励RIS模型识别相似视觉实体之间的细微差异和关系,并具体理解整个表达式以更好地定位正确目标。我们的方法在各种数据集和模型上表现出一致的改进,并通过大量实验得到验证。
引用
@article{arxiv.2411.01494,
title = {Finding NeMo: Negative-mined Mosaic Augmentation for Referring Image Segmentation},
author = {Seongsu Ha and Chaeyun Kim and Donghwa Kim and Junho Lee and Sangho Lee and Joonseok Lee},
journal= {arXiv preprint arXiv:2411.01494},
year = {2024}
}
备注
Accepted at ECCV 2024. Project page: https://dddonghwa.github.io/NeMo/