中文

面向鲁棒视觉问答的任务递进课程学习

计算机视觉与模式识别 2026-03-24 v2 机器学习

摘要

视觉问答(VQA)系统在分布迁移和数据稀缺情况下往往脆弱。虽然先前的解决方案——如集成方法和数据增强——在各自独立的情境下可以提高性能,但它们难以在分布内(IID)、分布外(OOD)和低数据设置下同时实现良好泛化。我们认为,这一局限性源于所采用训练策略的次优。具体而言,对所有训练样本采用统一处理——而不考虑问题的难度或语义结构——会使模型容易受数据偏见影响,难以超越训练分布。为此,本文引入了任务递进课程学习(Task-Progressive Curriculum Learning, TPCL)——一种简单且与模型无关的框架,通过考虑问题类型和难度构建课程来逐步训练 VQA 模型。具体而言,TPCL 首先根据问题的语义类型(例如 yes/no、计数)对问题进行分组,然后使用一种新颖的基于最优传输的难度度量对其进行排序。无需依赖数据增强或显式去偏,TPCL 在 IID、OOD 和低数据情境下均实现了更好的泛化能力,并在 VQA-CP v2、VQA-CP v1 和 VQA v2 上实现了最先进的性能。它在 VQA-CP v2 和 VQA-CP v1 上分别超过最具竞争力的鲁棒 VQA 基线 5% 和 7%,并使 backbone 性能提升最高可达 28.5%。

关键词

引用

@article{arxiv.2411.17292,
  title  = {TPCL: Task Progressive Curriculum Learning for Robust Visual Question Answering},
  author = {Ahmed Akl and Abdelwahed Khamis and Zhe Wang and Ali Cheraghian and Sara Khalifa and Kewen Wang},
  journal= {arXiv preprint arXiv:2411.17292},
  year   = {2026}
}

备注

Our source code is available at https://github.com/AhmedAAkl/tpcl