LitBench:用于创意写作可靠评估的基准与数据集
计算与语言
2025-07-02 v1 人工智能
摘要
评估大型语言模型 (LLM) 生成的创意写作仍具有挑战性,因为开放式叙事缺乏真实答案。缺乏高效的自动评估方法时,常用即插即用 (off-the-shelf, OTS) 语言模型以零样本方式充当评判器,但其可靠性尚不明确。为实现可靠的创意写作评估,本文引入 LitBench,首个标准化基准和配套数据集,用于创意写作验证,包含 2,480 组来自 Reddit 的去偏、人工标注的故事比较测试集,以及 43,827 对人类偏好标签的训练语料库。利用 LitBench,我们(i)对零样本 LLM 评判器进行基准测试,(ii)训练布拉顿-太尔 (Bradley-Terry) 模型和生成式奖励模型,(iii)开展在线人类研究,验证奖励模型在新生成的 LLM 故事中的排名与人类偏好的一致性。基准结果显示,Claude-3.7-Sonnet 为最强的即插即用评判器,达到 73% 的人类偏好一致率;在训练奖励模型中,布拉顿-太尔模型和生成式奖励模型均达到 78% 的准确率,均优于所有即插即用评判器。线上人类研究进一步确认,我们训练的奖励模型在新生成的 LLM 故事中始终与人类偏好保持一致。我们将 LitBench 和奖励模型于 https://huggingface.co/collections/SAA-Lab/litbench-68267b5da3aafe58f9e43461 公开,为可靠的自动化评估与创意写作系统优化提供可验证的资源。
引用
@article{arxiv.2507.00769,
title = {LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing},
author = {Daniel Fein and Sebastian Russo and Violet Xiang and Kabir Jolly and Rafael Rafailov and Nick Haber},
journal= {arXiv preprint arXiv:2507.00769},
year = {2025}
}