中文

基于多轮对话的用户像级推理分割

计算机视觉与模式识别 2025-02-14 v1 计算与语言

摘要

现有的视觉感知系统侧重于单轮对话中的区域级分割,依赖复杂且明确的查询指令,无法在像素层面进行推理,也无法理解随交互动态变化的用户意图。我们的工作通过引入基于多轮对话的用户像级推理分割(Pixel-level RS)新任务来解决此问题,跟踪通过多轮交互不断演变的用户意图,以实现细粒度分割。为建立此新任务的基准,我们构建了基于多轮对话的用户像级推理分割数据集(PRIST),包含 24k 条 utterances 来自 8.3k 种多轮对话情景,其中包含分割目标。基于 PRIST,我们进一步提出了 MIRAS,即一种多轮交互推理分割框架,集成了像素级分割与稳健的多轮对话理解,生成与用户意图一致的像素级解释。PRIST 数据集和 MIRAS 框架填补了用户像级推理分割的空白。在 PRIST 数据集上的实验结果表明,我们的方法在分割和基于 LLM 的推理指标方面均优于当前以分割为中心的基准方法。代码和数据已公开:https://github.com/ccccai239/PixelRIST。

关键词

引用

@article{arxiv.2502.09447,
  title  = {Pixel-Level Reasoning Segmentation via Multi-turn Conversations},
  author = {Dexian Cai and Xiaocui Yang and Yongkang Liu and Daling Wang and Shi Feng and Yifei Zhang and Soujanya Poria},
  journal= {arXiv preprint arXiv:2502.09447},
  year   = {2025}
}