中文

不要猜测,直接询问:通过多轮澄清解决指代分割歧义

计算机视觉与模式识别 2026-05-26 v2

摘要

指代分割旨在基于文本查询对图像或视频中的目标对象进行分割。尽管过去几年取得了显著进展,现有方法总是假设用户提供的查询已经是精确且清晰的。然而,这种假设是不切实际的。在实际场景中,难以期望所有用户都仔细审阅其视觉内容并确保查询唯一且无歧义。当遇到此类情况时,现有分割模型倾向于任意猜测用户偏好,常导致不理想的结果。为解决这一局限,本文提出 IC-Seg,一个通过多轮对话主动澄清用户意图的智能体框架。在此基础上,我们进一步引入 Hi-GRPO,一种新的分层优化策略,在轨迹、轮次和步骤级别注入稠密且信息丰富的监督信号。该策略鼓励高效意图澄清,有效消除冗余交互,提高整体对话质量。为进行评估,我们建立了 Ambi-RVOS,一个包含歧义用户查询的指代视频对象分割基准数据集。大量实验表明,IC-Seg 不仅在解决歧义查询方面显著优于现有方法,还在标准推理分割基准上保持最新水平的性能。代码和数据将发布于 https://github.com/iSEE-Laboratory/IC-Seg。

关键词

引用

@article{arxiv.2605.17531,
  title  = {Don't Guess, Just Ask: Resolving Ambiguity in Referring Segmentation via Multi-turn Clarification},
  author = {Yuting Yang and Haichao Jiang and Tianming Liang and Quan Zhang and Jian-Fang Hu},
  journal= {arXiv preprint arXiv:2605.17531},
  year   = {2026}
}