从确定到不确定:用于视频问答的不确定性感知课程学习
计算机视觉与模式识别
2026-01-06 v2
摘要
尽管视频问答(VideoQA)已取得显著进展,但现有研究在很大程度上忽视了通过定制难度调度来增强模型泛化能力的潜在益处。本文旨在通过将 VideoQA 纳入课程学习(CL)框架来弥补这一差距,该框架 progressively 训练模型从简单数据到复杂数据。认识到传统的自定进度 CL 方法依赖训练损失来衡量难度,这可能无法准确反映视频 - 问题对的复杂性,我们引入了不确定性感知 CL 的概念。在此,不确定性作为动态调整难度的指导原则。此外,我们通过提出一种用于 VideoQA 的概率建模方法来应对不确定性带来的挑战。具体而言,我们将 VideoQA 概念化为随机计算图,其中隐藏表示被视为随机变量。这产生了两种不同类型的不确定性:一种与数据固有的不确定性有关,另一种与模型的置信度有关。在实践中,我们将 VideoQA 模型无缝集成到我们的框架中,并进行了全面的实验。研究结果证实,我们的方法不仅实现了性能提升,而且有效地量化了 VideoQA 背景下的不确定性。
引用
@article{arxiv.2401.01510,
title = {Answering from Sure to Uncertain: Uncertainty-Aware Curriculum Learning for Video Question Answering},
author = {Haopeng Li and Mohammed Bennamoun and Jun Liu and Hossein Rahmani and Qiuhong Ke},
journal= {arXiv preprint arXiv:2401.01510},
year = {2026}
}
备注
Accepted by BMVC 2025