面向历史引导的迭代视觉推理 with 自我纠正
计算与语言
2026-02-05 v1 人工智能
多媒体
摘要
自洽性方法是提高多模态大语言模型(MLLM)推理可靠性的核心技术。通过多次重复抽样生成多个推理结果,并通过投票选择最佳答案,它们在跨模态任务中发挥着重要作用。然而,大多数现有的自洽性方法局限于固定的“重复抽样和投票”范式,未利用历史推理信息的重用。结果导致模型难以主动纠正视觉理解错误,在迭代过程中动态调整推理。灵感来源于人类重复验证和动态纠错推理行为,我们提出了 H-GIVR 框架。在迭代推理期间,MLLM 多次观察图像,并将先前生成的答案作为后续步骤的参考,实现对错误的动态纠正并提高答案准确率。我们在五个数据集和三个模型上进行了全面实验。结果表明,H-GIVR 框架能够在保持低计算成本的同时显著提高跨模态推理准确率。例如,使用 Llama3.2-vision:11b 在 ScienceQA 数据集上,模型仅需平均 2.57 次响应即可实现 78.90% 的准确率,相较于基线提升了 107%。
引用
@article{arxiv.2602.04413,
title = {History-Guided Iterative Visual Reasoning with Self-Correction},
author = {Xinglong Yang and Zhilin Peng and Zhanzhan Liu and Haochen Shi and Sheng-Jun Huang},
journal= {arXiv preprint arXiv:2602.04413},
year = {2026}
}