FeedEval:LLM 生成作文反馈的教学对齐评估
计算与语言
2026-01-09 v1
摘要
超越对数值分数的预测,自动作文评分领域的最新研究越来越强调生成提供正当理由和可操作指导的高质量反馈。为了减轻专家标注的高成本,先前的工作通常依赖 LLM 生成的反馈来训练作文评估模型。然而,此类反馈通常在未经明确质量验证的情况下即被纳入,导致噪声在下游应用中传播。为解决这一局限性,我们提出 FeedEval,一个基于 LLM 的框架,用于沿三个教学基础维度评估 LLM 生成的作文反馈:具体性、有用性和有效性。FeedEval 采用在本研究整理的数据集上训练的维度专用 LLM 评估器,以评估多个反馈候选并为下游使用选择高质量反馈。在 ASAP++ 基准上的实验表明,FeedEval 与人类专家判断高度一致,且使用经 FeedEval 筛选的高质量反馈训练的作文评分模型取得了更优的评分性能。此外,使用小型 LLM 的修改实验表明,FeedEval 识别出的高质量反馈能带来更有效的作文修改。我们将在论文被接收后发布代码和整理的数据集。
引用
@article{arxiv.2601.04574,
title = {FeedEval: Pedagogically Aligned Evaluation of LLM-Generated Essay Feedback},
author = {Seongyeub Chu and Jongwoo Kim and Munyong Yi},
journal= {arXiv preprint arXiv:2601.04574},
year = {2026}
}