语言模型是否喜欢自己的故事?提示大型语言模型进行自动故事评估
计算与语言
2024-05-24 v1
摘要
讲故事是人类经验中不可或缺的一部分,并在社会互动中扮演着关键角色。因此,自动故事评估(ASE)和生成(ASG)可以在多个方面造福社会,但它们是具有挑战性的任务,需要高水平的类人能力,如创造力、推理和深度理解。与此同时,大型语言模型(LLM)现在在许多NLP任务上达到了最先进的性能。在本文中,我们研究LLM是否可以用作ASE的人类标注者的替代品。我们对LLM评分、其他自动度量以及人类标注之间的相关性进行了广泛分析,并探讨了提示对结果的影响以及LLM行为的可解释性。最值得注意的是,我们发现LLM在系统级评估上优于当前的自动度量,但仍然难以对其答案提供令人满意的解释。
引用
@article{arxiv.2405.13769,
title = {Do Language Models Enjoy Their Own Stories? Prompting Large Language Models for Automatic Story Evaluation},
author = {Cyril Chhun and Fabian M. Suchanek and Chloé Clavel},
journal= {arXiv preprint arXiv:2405.13769},
year = {2024}
}
备注
TACL, pre-MIT Press publication version