MGA-VQA:基于记忆引导的图增强视觉问答框架 with 对抗式安全性与可解释性
计算机视觉与模式识别
2025-11-25 v1 人工智能
摘要
文档视觉问答(DocVQA)要求模型同时理解文本语义、空间布局和视觉特征。当前方法在显式空间关系建模、高分辨率文档效率、多跳推理和可解释性方面存在挑战。我们提出MGA-VQA,一种多模态框架集成了词级编码、空间图推理、记忆增强推理和问题导向压缩。不同于先前的黑箱模型,MGA-VQA引入可解释的图基决策路径和结构化记忆访问,以增强推理透明性。在六个基准测试(FUNSD、CORD、SROIE、DocVQA、STE-VQA和RICO)上的评估显示,MGA-VQA在准确率和效率方面均表现优异,在答案预测和空间定位方面均实现持续性改进。
引用
@article{arxiv.2511.17881,
title = {MGA-VQA: Secure and Interpretable Graph-Augmented Visual Question Answering with Memory-Guided Protection Against Unauthorized Knowledge Use},
author = {Ahmad Mohammadshirazi and Pinaki Prasad Guha Neogi and Dheeraj Kulshrestha and Rajiv Ramnath},
journal= {arXiv preprint arXiv:2511.17881},
year = {2025}
}