评估LLMs生成写作反馈的能力
计算与语言
2025-07-23 v1
摘要
LLM能否为创意作家提供有意义的写作反馈支持?本文通过定义新任务、数据集和评估框架,探讨了模型生成写作反馈的挑战和局限性。为以受控方式研究模型性能,我们提出了包含1300个故事的新测试集,通过故意引入写作问题进行篡改。我们研究了常用LLMs在该任务中的表现,采用自动和人类评估指标。我们的分析表明,当前模型在许多方面都表现出色——提供具体且大多数情况下准确的写作反馈。然而,模型常常未能识别故事中最大的写作问题,或正确决定何时提供批判性反馈而何时提供积极反馈。
引用
@article{arxiv.2507.16007,
title = {Help Me Write a Story: Evaluating LLMs' Ability to Generate Writing Feedback},
author = {Hannah Rashkin and Elizabeth Clark and Fantine Huot and Mirella Lapata},
journal= {arXiv preprint arXiv:2507.16007},
year = {2025}
}
备注
ACL 2025 main conference