LLM 的心灵之眼:可视化思维引发大语言模型的空间推理能力
计算与语言
2024-10-24 v3
摘要
大型语言模型(LLMs)在语言理解和各类推理任务中展现出惊人的性能。然而,他们在空间推理方面的能力——这是人类认知的关键方面——仍鲜有探索。人类拥有强大的能力,通过一种称为心灵之眼(Mind's Eye)的过程,能够创建对不可见对象和动作的 mental image,从而想象看不见的世界。 Inspired by this cognitive capacity,我们提出可视化思维(Visualization-of-Thought, VoT) prompting。VoT 旨在通过可视化 their reasoning traces 来引发 LLMs 的空间推理,从而引导后续推理步骤。我们对 VoT 用于多跳空间推理任务,包括自然语言导航、视觉导航和 2D 网格世界中的视觉拼图。实验结果表明,VoT 显著提升了 LLMs 的空间推理能力。值得注意的是,VoT 在这些任务中超越了现有的多模态大语言模型(MLLMs)。尽管 VoT 在 LLMs 中运行良好,但能够生成 mental image 以促进空间推理的能力类似于心灵之眼过程,表明其在 MLLMs 中潜在的可行性。请参阅 https://microsoft.github.io/visualization-of-thought 获取数据集和代码。
关键词
引用
@article{arxiv.2404.03622,
title = {Mind's Eye of LLMs: Visualization-of-Thought Elicits Spatial Reasoning in Large Language Models},
author = {Wenshan Wu and Shaoguang Mao and Yadong Zhang and Yan Xia and Li Dong and Lei Cui and Furu Wei},
journal= {arXiv preprint arXiv:2404.03622},
year = {2024}
}
备注
38th Conference on Neural Information Processing Systems (NeurIPS 2024)