中文

不完备上下文学习

计算机视觉与模式识别 2025-05-13 v1 人工智能

摘要

大型视觉语言模型(LVLMs)通过视觉上下文学习(VICL)取得了显著性能,这一过程在很大程度上依赖于从大量标注示例(检索数据库)中检索到的演示。现有研究通常假设检索数据库包含所有类别的标注示例。然而,在现实场景中,数据库更新的延迟或数据标注的不完整可能导致检索数据库仅包含部分类别的标注样本。我们将这种现象称为不完备检索数据库,并将此条件下的上下文学习定义为不完备上下文学习(IICL)。为了应对这一挑战,我们提出了迭代判断与集成预测(IJIP),这是一个旨在缓解IICL局限性的两阶段框架。迭代判断阶段将一个m类分类问题重新表述为一系列m个二分类任务,从而有效地将IICL设置转换为标准的VICL场景。集成预测阶段通过利用输入图像和迭代判断阶段的预测结果来进一步优化分类过程,以提高整体分类准确率。IJIP在两种LVLM和两个数据集上,在三种标签不完备条件下均表现出可观的性能,最高准确率达到93.9%。值得注意的是,即使在标签完全可用的情况下,IJIP仍然在所有六个基线中取得了最佳性能。此外,IJIP可以直接应用于提示学习,并且可以适应文本领域。

关键词

引用

@article{arxiv.2505.07251,
  title  = {Incomplete In-context Learning},
  author = {Wenqiang Wang and Yangshijie Zhang},
  journal= {arXiv preprint arXiv:2505.07251},
  year   = {2025}
}