中文

从静态到交互式:适配视觉上下文学习模型以支持用户驱动任务

计算机视觉与模式识别 2026-04-09 v1

摘要

视觉上下文学习模型旨在通过利用一组示例输入-输出对来适应新任务,从而实现快速泛化而无需任务特定微调。然而,这些模型运行在本质上静态的范式中:虽然它们能够适应新任务,但缺乏任何机制来整合用户提供的指导信号,如涂鸦、点击或边界框,以引导或细化预测过程。这一限制在现实应用中尤为严格,用户希望主动引导模型预测,例如通过高亮目标对象进行分割、指示应进行视觉更改的区域,或在复杂场景中隔离特定人物以运行目标姿态估计。在本工作中,我们提出了一种简单方法,将静态视觉上下文学习模型——特别是DeLVM方法——转化为高度可控、用户驱动的系统,即交互式DeLVM,通过涂鸦、点击或绘制边界框等自然视觉线索实现无缝交互。具体而言,通过将交互直接编码到示例输入-输出对中,我们保持了视觉上下文学习的核心理念:让用户无需微调即可用未见过的交互提示模型,并赋予他们通过个性化交互动态引导模型预测的能力。我们的实验表明,SOTA视觉上下文学习模型无法有效利用交互线索,往往完全忽略用户指导。相比之下,我们的方法在可控、用户引导场景中表现出色,在交互式分割方面实现了+7.95%的IoU提升,在定向超分辨率方面实现了+2.46 dB PSNR提升,在交互式目标移除方面实现了-3.14%的LPIPS降低。本工作弥合了刚性静态任务适应与以用户为中心的视觉上下文学习流体交互性之间的差距。

关键词

引用

@article{arxiv.2604.06748,
  title  = {From Static to Interactive: Adapting Visual in-Context Learners for User-Driven Tasks},
  author = {Carlos Schmidt and Simon Reiß},
  journal= {arXiv preprint arXiv:2604.06748},
  year   = {2026}
}