中文

用于演示 LLM 抽象能力的模块化数据集

人工智能 2025-03-25 v1 机器学习

摘要

大语言模型(LLMs)展现出惊人的能力,但在推理过程中仍因幻觉和逻辑缺陷而出现推理错误。为探索其推理内部表征,本研究引入 ArrangementPuzzle,一个具有结构化解答和自动分步正确性验证的数据集。我们在 LLM 激活特征上训练了一个分类器模型,发现其在预测推理正确性方面实现了 80% 以上的准确率,这表明 LLM 在内部区分正确与错误的推理步骤,最强的表征出现在 Transformer 网络的中后层。进一步分析表明,LLM 在 Transformer 架构的中层激活层中编码了抽象推理概念,能够区分逻辑等价与语义等价。这些发现为理解 LLM 推理机制提供了洞见,促进了 AI 可靠性和可解释性的提升,为操控与优化 LLM 推理提供了可能。

关键词

引用

@article{arxiv.2503.17645,
  title  = {A Modular Dataset to Demonstrate LLM Abstraction Capability},
  author = {Adam Atanas and Kai Liu},
  journal= {arXiv preprint arXiv:2503.17645},
  year   = {2025}
}

备注

7 pages, 5 figures. Submitted to ACL 2025