度量与改进视觉语言模型中的思维链推理
计算与语言
2024-03-21 v2 计算机视觉与模式识别
机器学习
摘要
视觉语言模型(VLMs)近来作为视觉助手展现出强大效能,能够解析关于视觉内容的自然查询并生成类人输出。在本工作中,我们探索这些模型基于所感知信息展现类人推理的能力。为解决关于其推理能力在多大程度上完全一致且 grounded 的关键关切,我们还度量了这些模型的推理一致性。我们通过提出一种基于思维链(CoT)的一致性度量来实现这一点。然而,此类评估需要一个涵盖高层推断与详细推理链的基准,而这代价高昂。我们通过提出一种 LLM-人类协同(LLM-Human-in-the-Loop)流水线应对该挑战,其显著降低成本同时确保了高质量数据集的生成。基于该流水线与现有粗粒度标注数据集,我们构建了 CURE 基准以度量 VLMs 的零样本推理性能与一致性。我们评估了现有最先进的 VLMs,发现即便性能最佳的模型也无法展现强大的视觉推理能力与一致性,表明要使 VLMs 像人类一样系统且一致地进行视觉推理仍需大量努力。作为早期步骤,我们提出一个两阶段训练框架,旨在同时改进 VLMs 的推理性能与一致性。第一阶段涉及使用由 LLMs 自动生成的逐步推理样本对 VLMs 进行有监督微调。第二阶段,我们通过融入 LLMs 提供的反馈进一步增广训练过程,以产生高度一致且 grounded 的推理链。我们凭经验凸显了我们的框架在推理性能与一致性两方面的有效性。
引用
@article{arxiv.2309.04461,
title = {Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models},
author = {Yangyi Chen and Karan Sikka and Michael Cogswell and Heng Ji and Ajay Divakaran},
journal= {arXiv preprint arXiv:2309.04461},
year = {2024}
}
备注
NAACL 2024 Main Conference. The data is released at https://github.com/Yangyi-Chen/CoTConsistency