ProtoVQA:一种用于可解释细粒度视觉问答的自适应原型框架
计算机视觉与模式识别
2025-09-23 v1 人工智能
机器学习
摘要
视觉问答(VQA)越来越多地应用于从通用视觉推理到安全关键领域(如医学成像和自主系统)的各种应用中,在这些领域中,模型不仅必须提供准确的答案,还必须提供人类易于理解和验证的解释。基于原型的建模通过将预测建立在语义上有意义的区域上,在纯视觉推理任务中显示出可解释性的前景,但在 VQA 的背景下仍未得到充分探索。我们提出 ProtoVQA,一个统一的原型框架,它 (i) 学习作为推理锚点的查询感知原型,将答案与判别性图像区域连接起来,(ii) 应用空间约束匹配以确保所选证据是连贯且语义相关的,以及 (iii) 通过共享的原型骨干网络支持答案生成和证据定位任务。为了评估解释质量,我们提出了视觉-语言对齐分数(VLAS),该分数衡量模型关注的区域与真实证据的对齐程度。在 Visual7W 上的实验表明,ProtoVQA 在保持有竞争力的准确性的同时,产生了忠实、细粒度的解释,推动了透明和可信赖的 VQA 系统的发展。
引用
@article{arxiv.2509.16680,
title = {ProtoVQA: An Adaptable Prototypical Framework for Explainable Fine-Grained Visual Question Answering},
author = {Xingjian Diao and Weiyi Wu and Keyi Kong and Peijun Qing and Xinwen Xu and Ming Cheng and Soroush Vosoughi and Jiang Gui},
journal= {arXiv preprint arXiv:2509.16680},
year = {2025}
}
备注
Accepted to EMNLP 2025 Main Conference