HyLoVQA:面向持续视觉问答的动态超网络生成低秩适配
计算机视觉与模式识别
2026-05-22 v1 计算与语言
摘要
持续视觉问答 (VQA) 需要在保持对过去知识的同时,从非平稳的视觉输入和问题流中学习。大多数先前方法通过更新大部分共享参数集来实现适应。这常常导致跨层级任务干扰,阻碍对当前任务和对象的准确适应。为此,我们提出 HyLoVQA。它维护一个 drift-resilient 的锚记存储库。存储库存储视觉对象和文本任务的内容,并使用当前输入特征进行更新。基于检索到的锚记,一个超网络生成轻量级低秩适配 (LoRA) 适配器。这确保了参数的高效性,使模型能够针对每个任务和对象动态适应。此外,我们构建一个 alignment loss,将特征空间中的语义差异与参数空间中的功能变化对齐,从而约束 LoRA 适配器专注于当前任务和对象。在 VQA v2 和 NExT-QA 上进行大规模实验,包括标准设置和组合设置,结果表明 HyLoVQA 在先前 SOTA 方法上取得优势。
引用
@article{arxiv.2605.22035,
title = {HyLoVQA: Dynamic Hypernetwork-Generated Low-Rank Adaptation for Continual Visual Question Answering},
author = {Yiran Wang and Chenyi Xiong and Ziyue Qin and Miao Zhang and Kui Xiao and Zhifei Li},
journal= {arXiv preprint arXiv:2605.22035},
year = {2026}
}
备注
Accepted by IJCAI 2026