中文

比较人类专家与大型语言模型嵌入在人格测试内容效度评估中的应用

人机交互 2025-03-18 v1 人工智能

摘要

在本文中,我们探讨了大型语言模型(LLM)在评估心理测量工具内容效度中的应用,重点关注大五问卷(BFQ)和大五清单(BFI)。内容效度是测验编制的基石,确保心理测量充分覆盖其预期构念。我们同时使用人类专家评估和先进的 LLM,比较了语义项目-构念对齐的准确性。研究生心理学学生使用内容效度比(CVR)对测试项目进行评分,形成了人类基线。同时,最先进的 LLM(包括多语言和微调模型)分析项目嵌入以预测构念映射。结果揭示了人类和 AI 方法各自的优势与局限。人类验证者在对齐行为丰富的 BFQ 项目方面表现出色,而 LLM 在处理语言简洁的 BFI 项目方面表现更好。训练策略显著影响 LLM 性能,针对词汇关系的模型优于通用 LLM。我们强调了整合人类专业知识和 AI 精度的混合验证系统的互补潜力。这些发现强调了 LLM 在心理评估中的变革性作用,为可扩展、客观和稳健的测验开发方法铺平了道路。

关键词

引用

@article{arxiv.2503.12080,
  title  = {Comparing Human Expertise and Large Language Models Embeddings in Content Validity Assessment of Personality Tests},
  author = {Nicola Milano and Michela Ponticorvo and Davide Marocco},
  journal= {arXiv preprint arXiv:2503.12080},
  year   = {2025}
}