中文

学习纠正:面向视觉常识推理干扰项的可解释反馈生成

计算机视觉与模式识别 2024-12-12 v1 人工智能 计算与语言

摘要

大型多模态模型(LMMs)在视觉常识推理(VCR)任务中展现出卓越的性能,该任务旨在基于图像中的视觉常识回答多选问题。然而,LMMs 在出现干扰项时纠正潜在视觉常识错误的能力尚未得到充分探索。灵感来源于人类教师如何精心设计难以分辨的干扰项以检验学生对概念或技能的理解,并帮助学生识别并纠正错误以得出答案,我们是首个为 LMMs 模拟这一错误纠正过程的研究。为此,我们运用 GPT-4 作为“教师”,收集可解释反馈数据集 VCR-DF,用于错误纠正,作为评估 LMMs 识别误解并阐明干扰项中错误原因以导向最终答案的基准。此外,我们提出一种基于 LMMs 的教育专家指导反馈生成模型(Pedagogical Expert Instructed Feedback Generation, PEIFG),以融合可学习的专家提示和多模态指令以引导反馈生成。实验结果表明,我们的 PEIFG 在现有 LMMs 方面显著优于现有方法。我们相信,本基准为评估 LMMs 的能力提供了新的方向。

关键词

引用

@article{arxiv.2412.07801,
  title  = {Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor},
  author = {Jiali Chen and Xusen Hei and Yuqi Xue and Yuancheng Wei and Jiayuan Xie and Yi Cai and Qing Li},
  journal= {arXiv preprint arXiv:2412.07801},
  year   = {2024}
}

备注

Accepted by ACM MM 2024