中文

学习判断: 人类能力超越生成式人工智能

计算与语言 2025-10-14 v3

摘要

大型语言模型(LLM)在 various language-based tasks中模仿人类认知能力日益增强。然而, 其在预测记忆表现的元认知能力 - 尤其是预测自身未来记忆表现的能力 - 仍未得到探讨。本文引入一种跨代理预测模型, 以评估基于ChatGPT的LLM是否与人类学习判断(Judgment of Learning, JOL)一致。JOL是一种元认知措施, 个人会预测自己的记忆表现。我们让人类和LLM对一对句子进行测试, 其中一个句子是garden-path句子 - 指在初始误导读者向错误解释方向倾斜后, 需进行重新解读的句子。通过操控语境适配度(适配 vs. 不适配句子), 我们探讨了内在线索(即相关性)如何同时影响LLM和人类的JOL。我们的结果显示, 虽然人类的JOL可靠地预测实际记忆表现, 但所测试的LLM(GPT-3.5-turbo, GPT-4-turbo和GPT-4o)均未展现出相当的预测准确性。这一差异在句子出现在适配或不适配语境中均然存在。这些发现表明, 尽管LLM在客观层面上能够建模人类认知, 但在元层面上仍 struggles, 未能捕捉到个体记忆预测的变异性。通过识别这一不足, 本研究强调了进一步完善LLM自我监控能力的必要性, 这可能提高其在教育场景、个性化学习和人机交互中的实用性。加强LLM的元认知性能可减少对人类监督的依赖, 为将AI更自主地集成到需要更深层认知意识的任务中铺平道路。

关键词

引用

@article{arxiv.2410.13392,
  title  = {Judgment of Learning: A Human Ability Beyond Generative Artificial Intelligence},
  author = {Markus Huff and Elanur Ulakçı},
  journal= {arXiv preprint arXiv:2410.13392},
  year   = {2025}
}

备注

24 pages, 2 figures