VIKSER:视觉知识驱动的自强化推理框架
计算机视觉与模式识别
2025-09-03 v2 人工智能
摘要
视觉推理是指解决关于视觉信息的问题的任务。当前的视觉推理方法通常采用预训练的视觉-语言模型(VLM)策略或深度神经网络方法。然而,现有的努力受到有限的推理可解释性的制约,同时也受到问题文本中欠明确现象的阻碍。此外,细粒度视觉知识的缺失限制了在视觉推理任务中对主体行为的精确理解。为了解决这些问题,我们提出了 VIKSER(视觉知识驱动的自强化推理框架)。具体来说,VIKSER 利用从大语言模型中蒸馏的知识进行训练,并借助视觉关系检测技术提取细粒度视觉知识。随后,VIKSER 利用细粒度视觉知识对存在欠明确性的问题进行释义。此外,我们设计了一种名为证据链(Chain-of-Evidence, CoE)的新型提示方法,该方法利用“证据推理”的力量赋予 VIKSER 可解释的推理能力。同时,自反思技术的集成赋予了 VIKSER 从错误中学习和改进的能力。在广泛使用的数据集上进行的实验表明,VIKSER 在相关任务中取得了新的最先进(SOTA)结果。此外,VIKSER 的性能与领先的专有模型(如最新的 ChatGPT-5)不相上下。
引用
@article{arxiv.2502.00711,
title = {VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework},
author = {Chao Wang and Chunbai Zhang and Yongxiao Tian and Yang Zhou and Yan Peng},
journal= {arXiv preprint arXiv:2502.00711},
year = {2025}
}
备注
14 pages,17 figures