R2SM:面向选择性掩码的指代与推理
计算机视觉与模式识别
2025-06-03 v1
摘要
我们引入了一项新任务——面向选择性掩码的指代与推理(R2SM),该任务通过结合由用户意图驱动的掩码类型选择,扩展了文本引导的分割。该任务要求视觉-语言模型仅根据自然语言提示,决定生成模态(可见)还是非模态(完整)的分割掩码。为了支持 R2SM 任务,我们提出了 R2SM 数据集,该数据集通过增强 COCOA-cls、D2SA 和 MUVA 的标注构建而成。R2SM 数据集包含模态和非模态文本查询,每个查询均配有相应的真实掩码,从而能够对模型根据用户意图分割图像的能力进行微调与评估。具体而言,该任务要求模型判断给定提示是指代物体的可见部分,还是包含遮挡区域在内的完整形状,随后生成相应的分割结果。例如,如果提示明确要求部分隐藏物体的完整形状,模型应输出补全遮挡部分的非模态掩码。相反,未明确提及隐藏区域的提示应生成标准的模态掩码。R2SM 基准为推进多模态推理和意图感知分割的研究提供了一个具有挑战性且富有洞察力的测试平台。
引用
@article{arxiv.2506.01795,
title = {R2SM: Referring and Reasoning for Selective Masks},
author = {Yu-Lin Shih and Wei-En Tai and Cheng Sun and Yu-Chiang Frank Wang and Hwann-Tzong Chen},
journal= {arXiv preprint arXiv:2506.01795},
year = {2025}
}