在成功与失败之间起舞:使用 SALSA 的编辑级文本简化评估
计算与语言
2023-10-24 v2
摘要
大语言模型(如 GPT-4)能够独特地生成高评分的文本简化,然而当前人工评估方法未能提供对系统具体优势与弱点的清晰理解。为应对此局限,我们引入 SALSA,一个基于编辑的人工标注框架,可实现整体且细粒度的文本简化评估。我们开发了二十一种基于语言学的编辑类型,覆盖概念、句法和词汇简洁性维度上成功与失败的完整谱系。使用 SALSA,我们在 840 条简化上收集了 19K 编辑标注,揭示了微调模型、提示型 LLMs 与人类所采用简化策略分布的差异,并发现 GPT-3.5 比人类执行了更多高质量编辑,但仍频繁出错。利用我们的细粒度标注,我们开发了 LENS-SALSA,一个无参考的自动简化指标,经训练可同时预测句子级和词级质量。此外,我们为简化引入了词级质量估计并报告了有前景的基线结果。我们的数据、新指标和标注工具包可在 https://salsa-eval.com 获取。
引用
@article{arxiv.2305.14458,
title = {Dancing Between Success and Failure: Edit-level Simplification Evaluation using SALSA},
author = {David Heineman and Yao Dou and Mounica Maddela and Wei Xu},
journal= {arXiv preprint arXiv:2305.14458},
year = {2023}
}
备注
Accepted to EMNLP 2023