中文

MulCogBench:用于评估中英文计算语言模型的多模态认知基准数据集

计算与语言 2024-03-05 v1

摘要

预训练计算语言模型最近在利用曾被认为是人类独有的语言能力方面取得了显著进展。它们的成功引发了人们关于这些模型是否像人类一样表征和处理语言的兴趣。为回答这一问题,本文提出了 MulCogBench,这是一个从母语为中文和英文的参与者那里收集的多模态认知基准数据集。它涵盖了多种认知数据,包括主观语义评级、眼动追踪、功能磁共振成像 (fMRI) 和脑磁图 (MEG)。为了评估语言模型与认知数据之间的关系,我们进行了相似性编码分析,该分析基于认知数据与文本嵌入的模式相似性来解码认知数据。结果表明,语言模型与人类认知数据存在显著相似性,且相似性模式受数据模态和刺激复杂度的调节。具体而言,随着语言刺激复杂度的增加,上下文感知模型的表现优于上下文无关模型。上下文感知模型的浅层与高时间分辨率的 MEG 信号更好地对齐,而深层则与高空间分辨率的 fMRI 显示出更多相似性。这些结果表明,语言模型与大脑语言表征之间存在微妙的关系。此外,中文和英文之间的结果高度一致,表明这些发现具有跨语言的泛化能力。

关键词

引用

@article{arxiv.2403.01116,
  title  = {MulCogBench: A Multi-modal Cognitive Benchmark Dataset for Evaluating Chinese and English Computational Language Models},
  author = {Yunhao Zhang and Xiaohan Zhang and Chong Li and Shaonan Wang and Chengqing Zong},
  journal= {arXiv preprint arXiv:2403.01116},
  year   = {2024}
}