中文

基于即时数字孪生的在线推理视频分割

计算机视觉与模式识别 2025-03-28 v1 图像与视频处理

摘要

推理分割(RS)旨在基于隐式文本查询识别和分割感兴趣的对象。因此,RS是具身AI代理的催化剂,使其能够在不要求明确的逐步指导的情况下解释高层命令。然而,当前的RS方法高度依赖多模态大型语言模型(LLM)的视觉感知能力,导致若干主要局限。首先,他们在需要多步推理或涉及复杂空间/时间关系的查询方面困难。其次,他们需要LLM微调,这可能需要频繁更新以保持与当代LLM的兼容性,并且可能增加灾难性遗忘风险。最后,由于主要为静态图像或离线视频处理设计,他们在扩展到在线视频数据方面效果不佳。为解决这些局限,我们提出了一个无需LLM微调即可实现在线视频RS的智能体框架,将感知与推理解耦。我们的创新点在于引入即时数字孪生概念,即——给定隐式查询——LLM计划从高层视频中使用专家视觉模型构建低层场景表示。我们将这种方法称为“即时”是因为LLM规划器会预判特定信息的需求,并仅请求此有限子集,而不是总是评估每个专家模型。LLM随后对该数字孪生表示进行推理以识别目标对象。为评估我们的approach,我们引入了一个新的全面视频推理分割基准,包含200个视频和895个隐式文本查询。该基准涵盖三个推理类别(语义、空间和时间)以及三种不同的推理链复杂度。

关键词

引用

@article{arxiv.2503.21056,
  title  = {Online Reasoning Video Segmentation with Just-in-Time Digital Twins},
  author = {Yiqing Shen and Bohan Liu and Chenjia Li and Lalithkumar Seenivasan and Mathias Unberath},
  journal= {arXiv preprint arXiv:2503.21056},
  year   = {2025}
}