中文

将大型语言模型纳入心理语言学标注工具箱:获取人类评分的最佳实践指南

计算与语言 2025-09-19 v1

摘要

词汇水平的心理语言学规范为语言处理理论提供了实证支持。然而,获取此类基于人类的测量方法并非总是可行或直接的。一种有前景的做法是利用大型语言模型 (LLM) 直接预测这些特征,对心理语言学和认知科学中的人类规范数据集进行增强,这一做法正迅速在该领域中获得普及。然而,这种方法的新颖性(以及 LLM 的相对不可解释性) necessitates 采用严格的方法论,以引导研究人员走在此过程之路上、呈现可能的各种方法,并阐明那些并非立即显而易见但可能在某些情况下使使用 LLM 变得不切实际的局限性。在本工作中,我们提出了一种全面的方法,用于估计词汇特征,丰富了实用建议和来自我们自身经验的教训。我们的做法涵盖了直接使用基础 LLM 和模型微调两种方式,后者在特定情境下可获得显著的性能提升。指南的主要强调点在于用人类“金标准”规范验证 LLM 生成的数据。我们还呈现了一个实现了本方法论的软件框架,支持商业和开源权重模型。我们以估计英语词汇熟悉度为案例研究。使用基础模型,我们实现了与人类评分的 0.8 的 Spearman 相关性,而采用微调模型后提升至 0.9。这种方法论、框架以及一组最佳实践旨在为未来在利用 LLM 进行心理语言学和词汇研究中提供参考。

关键词

引用

@article{arxiv.2509.14405,
  title  = {Adding LLMs to the psycholinguistic norming toolbox: A practical guide to getting the most out of human ratings},
  author = {Javier Conde and María Grandury and Tairan Fu and Carlos Arriaga and Gonzalo Martínez and Thomas Clark and Sean Trott and Clarence Gerald Green and Pedro Reviriego and Marc Brysbaert},
  journal= {arXiv preprint arXiv:2509.14405},
  year   = {2025}
}