通过输入归因细粒度分析大语言模型-大脑对齐
计算与语言
2025-10-15 v1
摘要
理解大型语言模型(LLM)与人类大脑活动之间的对齐性,可揭示语言处理的计算原理。我们引入一种细粒度输入归因方法,以识别大脑-LLM 对齐最关键的特定单词,并据此研究一个备受争议的研究问题:大脑对齐(BA)与下词预测(NWP)之间的关系。我们的发现表明,BA 与 NWP 依赖 largely 不同的单词子集:NWP 在语法方面表现出复occur 和 primacy 偏好,而 BA 优先语义和话语层次信息,recency 效应更具针对性。这项工作拓展了我们对LLM如何关联人类语言处理的理解,凸显了BA 与 NWP 在特征依赖方面的差异。除本研究外,我们的归因方法可广泛应用于探索 diverse 语言处理任务中模型预测的认知相关性。
引用
@article{arxiv.2510.12355,
title = {Fine-grained Analysis of Brain-LLM Alignment through Input Attribution},
author = {Michela Proietti and Roberto Capobianco and Mariya Toneva},
journal= {arXiv preprint arXiv:2510.12355},
year = {2025}
}