中文

VideoICL:面向分布外视频理解的基于置信度的迭代上下文学习

计算机视觉与模式识别 2024-12-04 v1 人工智能

摘要

视频大型多模态模型(LMM)的最新进展显著提升了其视频理解和推理能力。然而,它们在训练数据中代表性不足的分布外(OOD)任务上性能会下降。传统方法如对OOD数据集进行微调,由于计算成本高昂而不切实际。虽然带有演示示例的上下文学习(ICL)在无需微调的情况下,已在语言任务和图像-语言任务中展现出有前景的泛化性能,但将ICL应用于视频-语言任务面临挑战,因为视频LMM的上下文长度有限,而视频需要更长的token长度。为了解决这些问题,我们提出了VideoICL,一个面向OOD任务的新型视频上下文学习框架,该框架引入了一种基于相似度的相关示例选择策略和一种基于置信度的迭代推理方法。这使得能够选择最相关的示例并根据相似度对其进行排序,以用于推理。如果生成的响应置信度低,我们的框架会选择新的示例并再次执行推理,迭代地优化结果,直到获得高置信度的响应。这种方法通过扩展有效的上下文长度而不产生高昂成本,提高了OOD视频理解性能。在多个基准上的实验结果表明,性能有显著提升,尤其是在特定领域场景中,为更广泛的视频理解应用奠定了基础。代码将发布在https://github.com/KangsanKim07/VideoICL。

关键词

引用

@article{arxiv.2412.02186,
  title  = {VideoICL: Confidence-based Iterative In-context Learning for Out-of-Distribution Video Understanding},
  author = {Kangsan Kim and Geon Park and Youngwan Lee and Woongyeong Yeo and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2412.02186},
  year   = {2024}
}