中文

基于生成场景图的生成式视觉常识问答与解释

计算机视觉与模式识别 2025-01-17 v1 计算与语言

摘要

视觉常识推理被视为追求高级视觉场景理解的挑战性任务,曾用于诊断 AI 系统的推理能力。然而,可靠的推理需要良好地把握场景细节。现有工作未能有效利用场景中存在的真实世界对象关系信息,过度依赖训练记忆中的知识。基于此,我们提出一种名为 G2 的新型场景图增强视觉常识推理生成方法,该方法首先利用图像块和大语言模型构建无位置依赖的场景图,然后基于场景图信息进行问答与解释。我们还提出了自动场景图过滤和选择策略,以吸收训练期间有价值的场景图信息。对场景图构建和视觉常识问答解释等任务进行了广泛实验。实验结果和消融分析均显示我们所提出框架的有效性。

关键词

引用

@article{arxiv.2501.09041,
  title  = {Generative Visual Commonsense Answering and Explaining with Generative Scene Graph Constructing},
  author = {Fan Yuan and Xiaoyuan Fang and Rong Quan and Jing Li and Wei Bi and Xiaogang Xu and Piji Li},
  journal= {arXiv preprint arXiv:2501.09041},
  year   = {2025}
}