中文

视觉可解释子任务推理:视觉问答中的子任务感知模型

计算机视觉与模式识别 2025-05-14 v1

摘要

回答类似“哪些可用于坐的红色家具?”的复杂视觉问题需要进行多步推理,包括物体识别、属性过滤和关系理解。最近的研究通过将任务分解为子任务程序来提高多模态大语言模型(MLLM)的可解释性,但这些方法计算成本高昂且由于对目标数据适应性差,准确率较低。为此,我们引入 VISTAR(Visually Interpretable Subtask-Aware Reasoning Model),一种子任务驱动的训练框架,通过在 MLLM 中生成文本和视觉解释来提升可解释性和推理能力。无需依赖外部模型,VISTAR 对 MLLM 进行微调,使其产生结构化的子任务思维(Subtask-of-Thought)论证(逐步推理序列)。在两个基准数据集上的实验表明,VISTAR 在保持可解释性的同时持续提高推理准确率。我们的代码和数据集将在 https://github.com/ChengJade/VISTAR 公开。

关键词

引用

@article{arxiv.2505.08084,
  title  = {Visually Interpretable Subtask Reasoning for Visual Question Answering},
  author = {Yu Cheng and Arushi Goel and Hakan Bilen},
  journal= {arXiv preprint arXiv:2505.08084},
  year   = {2025}
}