思想景观:大语言模型推理过程的可视化
机器学习
2026-03-04 v4
摘要
大量大语言模型(LLM)的应用依赖于其执行逐步推理的能力。然而,LLM 的推理行为仍鲜有被理解,这给研究、开发和安全带来了挑战。为此,我们引入了思想景观(LoT),这是第一个用于检查特定推理方法在任意多选数据集上推理轨迹的景观可视化工具。我们将轨迹中的文本状态表示为量化其到答案选项之间距离的numerical features。这些特征随后使用 t-SNE 在二维图中进行可视化。利用思想景观进行的定性和定量分析有效区分了强模型与弱模型、正确答案与错误答案,以及不同的推理任务。它还揭示了不 desirable 的推理模式,如低一致性和高不确定性。用户还可以将 LoT 适用于他们观察的属性所预测的模型。我们通过将 LoT 适用于一个轻量级验证器来展示这一优势,该验证器评估轨迹的正确性。经验地表明,该验证器提高了推理准确率和测试时扩展效应。代码已公开 disponible at: https://github.com/tmlr-group/landscape-of-thoughts。
引用
@article{arxiv.2503.22165,
title = {Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models},
author = {Zhanke Zhou and Zhaocheng Zhu and Xuan Li and Mikhail Galkin and Xiao Feng and Sanmi Koyejo and Jian Tang and Bo Han},
journal= {arXiv preprint arXiv:2503.22165},
year = {2026}
}
备注
Accepted by ICLR 2026