中文

基于情境学习的个性化视觉

计算机视觉与模式识别 2025-09-30 v1 机器学习

摘要

现代视觉模型在大规模标注数据集上进行训练,擅长处理预定义任务,但在个性化视觉方面表现不足——即用户在测试时通过自定义对象或新颖目标来定义任务。现有的个性化方法依赖高成本的微调或合成数据管道,这些方法灵活性差且仅限于固定任务格式。视觉情境学习(in-context learning, ICL)提供了有前景的替代方案,但先前方法仅限于狭窄的领域内任务,无法实现开放式个性化。我们提出了个人化情境算子(Personalized In-Context Operator, PICO),一个简单四面板框架,将扩散变换器用作视觉情境学习器。给定单个标注示例后,PICO即可推断底层变换并应用于新输入,无需重新训练。为实现此目标,我们构建了VisRel数据集,该数据集紧凑且样本多样,表明任务多样性而非规模是驱动稳健泛化的关键。我们进一步提出了一种注意力引导的种子评分器,通过高效推理扩展提高可靠性。大量实验表明,PICO(1)超越了微调和合成数据基线方法,(2)灵活适应新的用户定义任务,(3)在识别和生成任务上实现跨域泛化。

关键词

引用

@article{arxiv.2509.25172,
  title  = {Personalized Vision via Visual In-Context Learning},
  author = {Yuxin Jiang and Yuchao Gu and Yiren Song and Ivor Tsang and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2509.25172},
  year   = {2025}
}

备注

Project page: https://yuxinn-j.github.io/projects/PICO