中文

评估LLMs生成写作反馈的能力

计算与语言 2025-07-23 v1

摘要

LLM能否为创意作家提供有意义的写作反馈支持?本文通过定义新任务、数据集和评估框架,探讨了模型生成写作反馈的挑战和局限性。为以受控方式研究模型性能,我们提出了包含1300个故事的新测试集,通过故意引入写作问题进行篡改。我们研究了常用LLMs在该任务中的表现,采用自动和人类评估指标。我们的分析表明,当前模型在许多方面都表现出色——提供具体且大多数情况下准确的写作反馈。然而,模型常常未能识别故事中最大的写作问题,或正确决定何时提供批判性反馈而何时提供积极反馈。

关键词

引用

@article{arxiv.2507.16007,
  title  = {Help Me Write a Story: Evaluating LLMs' Ability to Generate Writing Feedback},
  author = {Hannah Rashkin and Elizabeth Clark and Fantine Huot and Mirella Lapata},
  journal= {arXiv preprint arXiv:2507.16007},
  year   = {2025}
}

备注

ACL 2025 main conference