中文

ProtoVQA:一种用于可解释细粒度视觉问答的自适应原型框架

计算机视觉与模式识别 2025-09-23 v1 人工智能 机器学习

摘要

视觉问答(VQA)越来越多地应用于从通用视觉推理到安全关键领域(如医学成像和自主系统)的各种应用中,在这些领域中,模型不仅必须提供准确的答案,还必须提供人类易于理解和验证的解释。基于原型的建模通过将预测建立在语义上有意义的区域上,在纯视觉推理任务中显示出可解释性的前景,但在 VQA 的背景下仍未得到充分探索。我们提出 ProtoVQA,一个统一的原型框架,它 (i) 学习作为推理锚点的查询感知原型,将答案与判别性图像区域连接起来,(ii) 应用空间约束匹配以确保所选证据是连贯且语义相关的,以及 (iii) 通过共享的原型骨干网络支持答案生成和证据定位任务。为了评估解释质量,我们提出了视觉-语言对齐分数(VLAS),该分数衡量模型关注的区域与真实证据的对齐程度。在 Visual7W 上的实验表明,ProtoVQA 在保持有竞争力的准确性的同时,产生了忠实、细粒度的解释,推动了透明和可信赖的 VQA 系统的发展。

关键词

引用

@article{arxiv.2509.16680,
  title  = {ProtoVQA: An Adaptable Prototypical Framework for Explainable Fine-Grained Visual Question Answering},
  author = {Xingjian Diao and Weiyi Wu and Keyi Kong and Peijun Qing and Xinwen Xu and Ming Cheng and Soroush Vosoughi and Jiang Gui},
  journal= {arXiv preprint arXiv:2509.16680},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Main Conference