中文

在成功与失败之间起舞:使用 SALSA 的编辑级文本简化评估

计算与语言 2023-10-24 v2

摘要

大语言模型(如 GPT-4)能够独特地生成高评分的文本简化,然而当前人工评估方法未能提供对系统具体优势与弱点的清晰理解。为应对此局限,我们引入 SALSA,一个基于编辑的人工标注框架,可实现整体且细粒度的文本简化评估。我们开发了二十一种基于语言学的编辑类型,覆盖概念、句法和词汇简洁性维度上成功与失败的完整谱系。使用 SALSA,我们在 840 条简化上收集了 19K 编辑标注,揭示了微调模型、提示型 LLMs 与人类所采用简化策略分布的差异,并发现 GPT-3.5 比人类执行了更多高质量编辑,但仍频繁出错。利用我们的细粒度标注,我们开发了 LENS-SALSA,一个无参考的自动简化指标,经训练可同时预测句子级和词级质量。此外,我们为简化引入了词级质量估计并报告了有前景的基线结果。我们的数据、新指标和标注工具包可在 https://salsa-eval.com 获取。

关键词

引用

@article{arxiv.2305.14458,
  title  = {Dancing Between Success and Failure: Edit-level Simplification Evaluation using SALSA},
  author = {David Heineman and Yao Dou and Mounica Maddela and Wei Xu},
  journal= {arXiv preprint arXiv:2305.14458},
  year   = {2023}
}

备注

Accepted to EMNLP 2023