MacVQA:面向持续视觉问答的自适应内存分配与全局噪声过滤
计算机视觉与模式识别
2026-01-06 v1
摘要
视觉问答 (VQA) 需要模型对多模态信息进行推理,结合视觉和文本数据。随着持续学习的发展,在保持知识和适应新信息方面取得了显著进展。然而,当前方法往往在知识保留、适应性和稳健特征表示之间进行权衡。为此,我们提出一种新框架,采用自适应内存分配和全局噪声过滤,称为 MacVQA 用于视觉问答。MacVQA 在滤除噪声以确保稳健表征后,融合视觉和问题信息;并采用原型基内存分配以优化特征质量和内存使用。这些设计使 MacVQA 能够在持续 VQA 学习中实现知识获取、保留和组合推理的平衡。在十个持续 VQA 任务上的实验表明,MacVQA 在标准任务上平均准确率达到 43.38%,平均遗忘率为 2.32%;在新颖组合任务上平均准确率为 42.53%,平均遗忘率为 3.60%。
引用
@article{arxiv.2601.01926,
title = {MacVQA: Adaptive Memory Allocation and Global Noise Filtering for Continual Visual Question Answering},
author = {Zhifei Li and Yiran Wang and Chenyi Xiong and Yujing Xia and Xiaoju Hou and Yue Zhao and Miao Zhang and Kui Xiao and Bing Yang},
journal= {arXiv preprint arXiv:2601.01926},
year = {2026}
}
备注
Accepted to AAAI 2026