揭示人类类似表示在大语言模型中的计算要素
人工智能
2025-10-02 v1
摘要
将多样化的输入模式翻译为结构化的行为模式的能力被认为依赖于人类和机器学习对相关概念具有稳健表示的能力。基于Transformer的大语言模型(LLM)的快速发展导致计算要素的多样化——包括架构、微调方法和训练数据集等——但仍不清楚哪些要素对于构建开发出类人表示的模型最为关键。此外,大多数现有LLM基准测试不适合衡量人类和模型之间的 representational alignment,使得基准得分不可靠地用于评估当前LLM在向有用认知模型发展 progress。我们通过首先评估一组超过70个在计算要素上广泛变异的模型,针对来自THINGS数据库的概念进行三元相似性任务(认知科学中衡量人类概念表示的方法),来应对这些限制。通过比较人类和模型表示,我们发现经历指令微调且注意力头维度更大的模型在人类对齐方面最为突出,而多模态预训练和参数规模对对齐影响有限。对齐得分与现有基准得分之间的相关性表明,尽管一些基准(如MMLU)比其他基准(如MUSR)在捕捉 representational alignment方面更合适,但没有任何现有基准能够完全解释对齐得分的方差,显示其在捕捉人类-人工智能对齐方面不足。总体而言,我们的发现帮助突出了推进LLM towards models of human conceptual representation最必需的计算要素,并解决了LLM评估中的关键基准测试差距。
引用
@article{arxiv.2510.01030,
title = {Uncovering the Computational Ingredients of Human-Like Representations in LLMs},
author = {Zach Studdiford and Timothy T. Rogers and Kushin Mukherjee and Siddharth Suresh},
journal= {arXiv preprint arXiv:2510.01030},
year = {2025}
}
备注
9 pages