Sonnet 或 非 Sonnet?大模型与数据集的诗歌评估
计算与语言
2024-10-14 v3
摘要
大型语言模型(LLMs)现在能够生成和识别诗歌,但它们对诗歌真正了解多少呢?我们开发了一个任务,以评估大型语言模型识别英语诗歌一个方面——诗歌形式——的能力,这一形式捕捉了诗歌的许多不同特征,包括韵律、格律以及词语或行的重复。通过使用包含 4100 多个人类专家标注诗歌的基准数据集,我们展示,最新的大型语言模型能够成功识别常见和不常见的固定诗歌形式——如十四行诗、七言体和抱抱诗——的准确率相当高。然而,性能因诗歌形式而异;模型在识别非固定诗歌形式方面表现有限,尤其是那些基于主题或视觉特征的形式。我们还测量了来自我们基准数据集中多少诗歌出现在流行预训练数据集中或被 GPT-4 记忆,其中发现预训练存在和记忆可能提高该任务的性能,但结果尚不确定。我们发布了一个包含 1400 首公共领域诗歌并带有形式注释的数据集,记忆实验和数据审计结果,以及代码。
引用
@article{arxiv.2406.18906,
title = {Sonnet or Not, Bot? Poetry Evaluation for Large Models and Datasets},
author = {Melanie Walsh and Anna Preus and Maria Antoniak},
journal= {arXiv preprint arXiv:2406.18906},
year = {2024}
}
备注
2024 EMNLP Findings