测量语言模型中的心理深度
计算与语言
2024-10-07 v2
摘要
对大型语言模型(LLM)生成的创意故事的评估通常侧重于文本的客观属性,如其风格、连贯性和多样性。虽然这些指标不可或缺,但它们并未从读者角度说明故事的主观心理影响。我们引入了心理深度量表(PDS),这是一个植根于文学理论的新颖框架,用于衡量LLM产生真实且叙事复杂的故事以激发情感、共情和参与度的能力。我们通过实证验证了我们的框架,表明人类可以基于PDS一致地评估故事(Krippendorff's alpha为0.72)。我们还探索了自动化PDS的技术,以便轻松扩展未来的分析。GPT-4o结合新颖的混合人格(MoP)提示策略,与人类判断的平均Spearman相关系数为0.51,而使用约束解码的Llama-3-70B在共情方面的得分高达0.68。最后,我们比较了人类和LLM创作的故事的深度。令人惊讶的是,GPT-4的故事要么超过了来自Reddit的高评价人类撰写故事,要么在统计上与之无法区分。通过将焦点从文本转移到读者,心理深度量表是一种经过验证、自动化且系统化的方法,用于衡量LLM通过其讲述的故事与人类建立联系的能力。
引用
@article{arxiv.2406.12680,
title = {Measuring Psychological Depth in Language Models},
author = {Fabrice Harel-Canada and Hanyu Zhou and Sreya Muppalla and Zeynep Yildiz and Miryung Kim and Amit Sahai and Nanyun Peng},
journal= {arXiv preprint arXiv:2406.12680},
year = {2024}
}
备注
EMNLP 2024