中文

心理语言学词汇特征:评估 LLM 与人类对齐的新方法

计算与语言 2025-07-01 v1 人工智能

摘要

LLM 评估过去主要聚焦于其执行推理、问答、改写或翻译等任务的能力。对于这些任务,性能可通过客观指标(如正确答案数量)进行衡量。然而,其他语言特征难以量化。例如,某个单词与唤起、具体性或性别关联的程度,以及我们体验单词语义并将其关联到特定语义的程度,这些特征已被心理语言学研究多年,进行大规模人类实验以为数千个单词生成评级。这为评估 LLM 是否与人类在这些词汇特征上的评级保持对齐提供了机会,充分利用已覆盖众多语言特征且覆盖大量单词的既有研究。在本文中,我们在两个代表性心理语言学数据集(Glasgow 和 Lancaster 规范)上,对齐一批代表性 LLM 的对齐情况。这两个数据集涵盖十三项特征及数千个单词。结果显示,Glasgow 规范(唤起、价值、支配、具体性、可形象化、熟悉度、性别)的对齐通常优于 Lancaster 规范(内感受、味觉、嗅觉、触觉、听觉、视觉)。这表明当前 LLM 在与人类感官关联词汇对齐方面可能存在局限,这可能源于其缺乏人类所具备的具身认知,说明了使用心理语言学数据集评估 LLM 的有用性。

关键词

引用

@article{arxiv.2506.22439,
  title  = {Psycholinguistic Word Features: a New Approach for the Evaluation of LLMs Alignment with Humans},
  author = {Javier Conde and Miguel González and María Grandury and Gonzalo Martínez and Pedro Reviriego and Mar Brysbaert},
  journal= {arXiv preprint arXiv:2506.22439},
  year   = {2025}
}

备注

Accepted for the GEM2 workshop at ACL 2025