LFED:用于大语言模型的文学小说评估数据集
计算与语言
2024-05-17 v1 性能
摘要
大型语言模型(LLMs)的快速发展带来了对其在各个维度上性能进行全面评估的需求。本文提出了 LFED, 一个文学小说评估数据集, 旨在评估 LLMs 在长篇文学作品理解和推理方面的能力。我们收集了 95 部最初以中文原创或翻译成中文的文学小说, 涵盖数个世纪的多个主题。我们定义了 8 个问题类别以指导创建 1304 个问题。此外, 我们深入分析了文学小说的特定属性(如小说类型、人物数量、出版年份)对 LLM 在评估中的表现的影响。通过一系列基于最新技术的 LLMs 实验, 我们展示了这些模型在解答与文学小说相关的问题时面临重大挑战, 在零样本设置下, ChatGPT 仅达到 57.08% 的准确率。该数据集将在 https://github.com/tjunlp-lab/LFED.git 上公开。
引用
@article{arxiv.2405.10166,
title = {LFED: A Literary Fiction Evaluation Dataset for Large Language Models},
author = {Linhao Yu and Qun Liu and Deyi Xiong},
journal= {arXiv preprint arXiv:2405.10166},
year = {2024}
}