中文

苏格拉底式提问:学习在野外自我引导多模态推理

计算机视觉与模式识别 2025-01-08 v2 人工智能

摘要

复杂的视觉推理至今仍是一个关键挑战。通常,该挑战通过思维链(COT)和视觉指令微调等方法来解决。然而,如何有机地结合这两种方法以获得更大的成功仍未被探索。此外,幻觉和高训练成本等问题仍需解决。在这项工作中,我们设计了一种创新的多轮训练和推理框架,适用于轻量级多模态大语言模型(MLLM)。我们的自提问方法启发式地引导MLLM关注与目标问题相关的视觉线索,减少幻觉并增强模型描述细粒度图像细节的能力。这最终使模型在复杂的视觉推理和问答任务中表现良好。我们将此框架命名为苏格拉底式提问(SQ)。为了促进未来的研究,我们创建了一个名为CapQA的多模态迷你数据集,包含1000张细粒度活动的图像,用于视觉指令微调和评估。我们提出的SQ方法在幻觉评分上提高了31.2%。我们在各种基准上的大量实验证明了SQ在启发式自提问、零样本视觉推理和幻觉缓解方面的卓越能力。我们的模型和代码将公开。

关键词

引用

@article{arxiv.2501.02964,
  title  = {Socratic Questioning: Learn to Self-guide Multimodal Reasoning in the Wild},
  author = {Wanpeng Hu and Haodi Liu and Lin Chen and Feng Zhou and Changming Xiao and Qi Yang and Changshui Zhang},
  journal= {arXiv preprint arXiv:2501.02964},
  year   = {2025}
}