中文

文本失语电池(TAB):用于语言模型中失语样缺陷的临床依据基准

计算与语言 2025-11-26 v1 人工智能

摘要

大型语言模型(LLM)作为人类语言的“模型生物”,为研究语言障碍如失语的计算基础提供了前所未有的机会。然而,传统临床评估不适用于LLM,因其预设了人类式的实用主义压力,且探测的认知过程并非人工架构所固有的。我们引入文本失语电池(Text Aphasia Battery, TAB),这是一种改编自快速失语电池(Quick Aphasia Battery, QAB)的文本基准测试,用于评估LLM中的失语样缺陷。TAB包含四个子测试:连贯文本、词汇理解、句子理解和重复。本文详细阐述了TAB的设计、子测试及评分标准。为促进大规模应用,我们验证了使用Gemini 2.5 Flash进行自动化评估的协议,其可靠性与专家人类评估员相当(模型-共识一致性加权 Cohen's kappa = 0.255, 人类-人类一致性为 0.286)。我们发布TAB作为一个临床依据且可扩展的框架,用于分析人工系统中的语言缺陷。

关键词

引用

@article{arxiv.2511.20507,
  title  = {The Text Aphasia Battery (TAB): A Clinically-Grounded Benchmark for Aphasia-Like Deficits in Language Models},
  author = {Nathan Roll and Jill Kries and Flora Jin and Catherine Wang and Ann Marie Finley and Meghan Sumner and Cory Shain and Laura Gwilliams},
  journal= {arXiv preprint arXiv:2511.20507},
  year   = {2025}
}