DDCoT:面向语言模型多模态推理的职责分离思维链提示
计算机视觉与模式识别
2023-10-27 v2 计算与语言
摘要
AI 系统的一个长期目标是像人类一样执行复杂的多模态推理。近来,大语言模型(LLM)仅通过利用思维链(CoT)来模仿人类思考,就在语言模态上的多步推理取得了显著进展。然而,这些进展向多模态语境的迁移引入了更高的挑战,包括但不限于对劳动密集型标注的不切实际需求,以及在灵活性、泛化性和可解释性方面的局限。为在多模态中唤起 CoT 推理,本工作首先对这些由多模态带来的挑战进行深入分析,并提出两个关键见解:多模态 CoT 推理中的“保持批判性思考”与“让各司其职”。此外,本研究提出一种新颖的 DDCoT 提示,它通过负空间提示保持批判态度,并将多模态纳入推理——先将 LLM 的推理职责划分为推理与识别,再将视觉模型的视觉识别能力整合进联合推理过程。DDCoT 生成的推理依据不仅提升了大、小语言模型在零样本提示与微调学习中的推理能力,显著优于最先进方法,还展现出令人印象深刻的泛化性与可解释性。
引用
@article{arxiv.2310.16436,
title = {DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models},
author = {Ge Zheng and Bin Yang and Jiajin Tang and Hong-Yu Zhou and Sibei Yang},
journal= {arXiv preprint arXiv:2310.16436},
year = {2023}
}
备注
24 pages, 13 figures, to be published in NeurIPS 2023