识别科学文本修订的可靠评估指标
计算与语言
2026-01-26 v5
摘要
评估科学写作中的文本修订仍是一个挑战,因为传统指标如 ROUGE 和 BERTScore 主要关注相似度,而难以捕捉有意义的改进。本文分析并识别了这些指标的局限性,探索更贴近人类判断的替代评估方法。我们首先进行手动标注研究,以评估不同修订的质量。随后,我们检验来自相关 NLP 领域的 reference-free 评估指标。此外,我们检阅了 LLM-as-a-judge 方法,分析其在有或无金标准参考的情况下评估修订的能力。我们的结果表明,LLM 在评估指令遵循方面效果良好,但在评估正确性方面存在困难,而领域特定指标则提供了互补性见解。我们发现,结合 LLM-as-a-judge 评估与任务特定指标的混合方法,能够最可靠地评估修订质量。
引用
@article{arxiv.2506.04772,
title = {Identifying Reliable Evaluation Metrics for Scientific Text Revision},
author = {Léane Jourdan and Florian Boudin and Richard Dufour and Nicolas Hernandez},
journal= {arXiv preprint arXiv:2506.04772},
year = {2026}
}
备注
V5 contains the English version, (ACL 2025 main, 26 pages) and V4 contains the French version (TALN 2025, 32 pages), both with corrected results for cramer's v and pairwise accuracy