中文

THiNK:大语言模型能否进行出声思考?

计算与语言 2025-05-27 v1 人工智能

摘要

评估大语言模型(LLM)的高阶思维技能仍然是一个根本性的挑战,尤其是在超越表面准确性的任务中。在本工作中,我们提出了 THiNK(Testing Higher-order Notion of Knowledge,测试高阶知识概念),这是一个基于 Bloom 分类法的多智能体、反馈驱动的评估框架。THiNK 将推理评估构建为问题生成、批评和修订的迭代任务,鼓励 LLM 通过逐步反思和改进进行出声思考。这使得能够对低阶(例如,记忆、理解)和高阶(例如,评估、创造)思维技能进行系统评估。我们将 THiNK 应用于七个最先进的 LLM,并对其输出进行了详细的认知分析。结果显示,虽然模型在低阶类别上表现可靠,但它们在现实情境中应用知识方面存在困难,且抽象能力有限。结构化反馈循环显著提高了推理性能,尤其是在高阶思维方面。定性评估进一步证实,THiNK 引导的输出更好地与领域逻辑和问题结构相一致。我们框架的代码为探测和增强 LLM 推理提供了一种可扩展的方法,为基于学习科学的评估提供了新方向,代码可在我们的 GitHub 仓库中获取。

关键词

引用

@article{arxiv.2505.20184,
  title  = {THiNK: Can Large Language Models Think-aloud?},
  author = {Yongan Yu and Mengqian Wu and Yiran Lin and Nikki G. Lobczowski},
  journal= {arXiv preprint arXiv:2505.20184},
  year   = {2025}
}