中文

用于计算机视觉上下文学习的灵活视觉提示

计算机视觉与模式识别 2023-12-12 v1

摘要

在这项工作中,我们针对图像分割任务中的上下文学习(ICL)问题,引入了一种新颖的方法,该方法将现代视频对象分割(VOS)技术适配用于视觉上下文学习。这一适配的灵感来源于 VOS 方法能够从少量示例中高效且灵活地学习对象的能力。通过在一系列支持集大小和多样化分割数据集上的评估,我们的方法始终优于现有技术。值得注意的是,它在处理包含训练期间未遇到类别的数据时表现出色。此外,我们提出了一种支持集选择技术,该技术涉及选择最相关的图像包含到该集合中。通过采用支持集选择,所有测试方法的性能都得到了提升,而无需额外的训练或提示微调。代码可在 https://github.com/v7labs/XMem_ICL/ 获取。

关键词

引用

@article{arxiv.2312.06592,
  title  = {Flexible visual prompts for in-context learning in computer vision},
  author = {Thomas Foster and Ioana Croitoru and Robert Dorfman and Christoffer Edlund and Thomas Varsavsky and Jon Almazán},
  journal= {arXiv preprint arXiv:2312.06592},
  year   = {2023}
}