中文

DDCoT:面向语言模型多模态推理的职责分离思维链提示

计算机视觉与模式识别 2023-10-27 v2 计算与语言

摘要

AI 系统的一个长期目标是像人类一样执行复杂的多模态推理。近来,大语言模型(LLM)仅通过利用思维链(CoT)来模仿人类思考,就在语言模态上的多步推理取得了显著进展。然而,这些进展向多模态语境的迁移引入了更高的挑战,包括但不限于对劳动密集型标注的不切实际需求,以及在灵活性、泛化性和可解释性方面的局限。为在多模态中唤起 CoT 推理,本工作首先对这些由多模态带来的挑战进行深入分析,并提出两个关键见解:多模态 CoT 推理中的“保持批判性思考”与“让各司其职”。此外,本研究提出一种新颖的 DDCoT 提示,它通过负空间提示保持批判态度,并将多模态纳入推理——先将 LLM 的推理职责划分为推理与识别,再将视觉模型的视觉识别能力整合进联合推理过程。DDCoT 生成的推理依据不仅提升了大、小语言模型在零样本提示与微调学习中的推理能力,显著优于最先进方法,还展现出令人印象深刻的泛化性与可解释性。

关键词

引用

@article{arxiv.2310.16436,
  title  = {DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models},
  author = {Ge Zheng and Bin Yang and Jiajin Tang and Hong-Yu Zhou and Sibei Yang},
  journal= {arXiv preprint arXiv:2310.16436},
  year   = {2023}
}

备注

24 pages, 13 figures, to be published in NeurIPS 2023