大语言模型的自省概念是否合理?
计算与语言
2025-06-09 v2 人工智能
摘要
大语言模型(LLMs)表现出引人注目的语言行为,偶尔会提供关于自身性质、内部工作或行为的自我报告。在人类中,这类报告通常归因于自省能力,通常与意识联系。在给定LLMs日益流畅的语言能力和认知能力后,如何解释LLMs产生的自我报告是一个值得探讨的问题。若干(如果有的话),自省概念能否被有意义地应用于LLMs?本文我们呈现并批判了两种LLMs显然自省自我报告的示例。首先,一个LLM尝试描述其自身“创造性”写作背后的过程,我们认为这并非有效的自省示例。在第二个示例中,LLM正确推断了其自身温度参数的值,我们认为这可以被合法地视为一种最小化的自省示例,尽管可能并不伴随意识体验。
引用
@article{arxiv.2506.05068,
title = {Does It Make Sense to Speak of Introspection in Large Language Models?},
author = {Iulia M. Comsa and Murray Shanahan},
journal= {arXiv preprint arXiv:2506.05068},
year = {2025}
}