中文

基于不确定性引导的自问自答视频语言对齐

计算机视觉与模式识别 2025-05-07 v2 人工智能

摘要

多模态模型的开发正在迅速 advancement, 但注释视频文本对仍然昂贵且不足。以视频问答(VideoQA)任务为例, 人类注释的提问和答案往往仅覆盖视频的部分内容, 由于相应文本常短且单调, 导致视频未被充分利用。为此, 我们提出一种引导式视频语言对齐框架(BoViLA), 一种自训练方法, 通过LLM-based自问自答在训练过程中扩充问题样本, 有助于模型更充分地利用视频信息和LLM的内部知识以提高模态对齐。然而, 低质量的自生成问题可能反而污染性能, 尤其是在训练初期, 正如我们在实验中所观察到的。为筛选差质的自生成问题, 我们引入evidential deep learning(EDL)来估计不确定性并评估自生成问题的质量, 通过评估上下文中的模态对齐来实现。到目前为止, 本工作是首次探索LLM-based自训练框架用于模态对齐。我们在五个强大的VideoQA基准上评估了BoViLA, 在多个 state-of-the-art 方法上取得优势, 并展示了其有效性和通用性。此外, 我们对自训练框架和EDL-based不确定性过滤机制提供了广泛分析。代码将予以公开。

关键词

引用

@article{arxiv.2410.02768,
  title  = {Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment},
  author = {Jin Chen and Kaijing Ma and Haojian Huang and Han Fang and Hao Sun and Mehdi Hosseinzadeh and Zhe Liu},
  journal= {arXiv preprint arXiv:2410.02768},
  year   = {2025}
}