变压器前向传递中人类类比处理的特征
人工智能
2025-05-20 v2 计算与语言
摘要
现代 AI 模型正日益被用作研究人类认知的理论工具。其中一种主导方法是评估人类衍生度量是否被模型输出所预测,即模型前向传递的终端产物。然而,近期在机制可解释性方面的进展开始揭示模型输出产生的内部过程,引发了一个问题:模型是否可能使用类似人类的处理策略。本文我们检验了人类实时处理与变压器计算中层级时间动态之间的关系,在 20 个开源模型中测试了 6 个领域。我们首先探讨前向传递是否显示竞争性干扰的机制特征,借鉴认知理论中的高层次灵感。我们发现模型确实在我们期望人类出现决策冲突的情况下,最初会偏向竞争性错误答案。随后我们系统性地测试了前向传递动态是否能预测人类处理特征,这些特征超越了模型输出概率分布的属性。我们发现动态度量相对于静态最终层度量在预测人类处理度量方面更有效。此外,在我们的实验中,更大的模型并不总是显示更类似人类的处理模式。我们的工作表明,AI 模型用于研究人类认知的新方法:不仅仅是将刺激映射到响应的黑盒子,还可能作为显式的处理模型。
引用
@article{arxiv.2504.14107,
title = {Signatures of human-like processing in Transformer forward passes},
author = {Jennifer Hu and Michael A. Lepori and Michael Franke},
journal= {arXiv preprint arXiv:2504.14107},
year = {2025}
}
备注
under review