中文

面向音视频多任务增量学习的渐进式稳态与可塑性提示调优

人工智能 2025-07-30 v1 计算机视觉与模式识别

摘要

音视频多任务增量学习旨在无需对所有任务进行联合训练的情况下持续学习多个音视频任务。该问题的挑战在于如何在保留旧任务知识的同时,利用以往经验促进新任务的学习。在解决这些挑战方面,我们引入了三阶段渐进式稳态与可塑性音视频提示(PHP)方法。在浅层阶段,我们设计了任务共享的模态聚合适配器,以促进跨任务和跨模态的音视频表征学习,从而增强任务之间的共享理解。在中期阶段,我们提出了任务特定的模态共享动态生成适配器,构建针对个体任务且跨模态通用的提示,在模型保留知识与防止遗忘之间以及其多任务可迁移性之间取得平衡。在深层阶段,我们引入任务特定的模态独立提示,以针对每个任务和模态的个性化信息进一步细化理解能力。通过引入这三个阶段,PHP在保留任务特定提示的同时,适配新任务的共享参数,从而有效平衡知识共享与特定性。我们的方法在不同的任务顺序(AVE、AVVP、AVS和AVQA)中实现了最先进的性能。我们的代码可在 https://github.com/ENJOY-Yin-jiong/PHP 查看。

关键词

引用

@article{arxiv.2507.21588,
  title  = {Progressive Homeostatic and Plastic Prompt Tuning for Audio-Visual Multi-Task Incremental Learning},
  author = {Jiong Yin and Liang Li and Jiehua Zhang and Yuhan Gao and Chenggang Yan and Xichun Sheng},
  journal= {arXiv preprint arXiv:2507.21588},
  year   = {2025}
}

备注

Accepted by ICCV 2025