VIOLA:面向最小标注的视频上下文学习
计算机视觉与模式识别
2026-01-23 v1 人工智能
摘要
将多模态大语言模型(MLLMs)泛化到新的视频领域对于实际部署至关重要,但由于标注数据的稀缺性,这仍然具有挑战性。尽管上下文学习(ICL)提供了一种无需训练的适应路径,但标准方法依赖于庞大的标注池,这在工业或外科等专业环境中通常是不切实际的,因为它们需要专家标注。为了弥合这一差距,我们引入了 VIOLA(Video In-cOntext Learning with minimal Annotation,最小标注视频上下文学习),这是一个标签高效的框架,将最小的专家监督与丰富的未标注数据协同起来。首先,为了最大化严格标注预算的效率,我们提出了密度-不确定性加权采样。与可能选择视觉异常值的标准多样性或不确定性策略不同,我们的方法利用密度估计来识别同时具备多样性、代表性和信息量的样本。其次,为了在没有噪声传播的情况下利用剩余的未标注数据,我们构建了一个混合池,并引入了置信度感知检索和置信度感知提示。这些机制显式地对标签可靠性进行建模,基于相似度和置信度的综合评分检索演示,同时使 MLLM 能够自适应地区分已验证的真实标签和有噪声的伪标签。在九个不同的基准上使用四个 MLLM 进行的大量实验表明,我们的框架在低资源设置下显著优于各种基线,以最小的标注成本实现了稳健的适应。
引用
@article{arxiv.2601.15549,
title = {VIOLA: Towards Video In-Context Learning with Minimal Annotations},
author = {Ryo Fujii and Hideo Saito and Ryo Hachiuma},
journal= {arXiv preprint arXiv:2601.15549},
year = {2026}
}