中文

比较摘要模型需要多少标注?

计算与语言 2024-03-01 v1

摘要

现代指令调优模型在文本生成任务(如摘要)中已经变得非常强大,并且预计会以稳定的速度发布。在实践中,人们可能希望以最小的努力自信地选择在应用于新领域或目的时性能最佳的摘要模型。在这项工作中,我们实证研究了在新闻摘要背景下选择首选模型所需的测试样本量。实证结果表明,对于自动评估和人工评估,比较评估都迅速收敛,在不到100个样本的情况下就出现了对系统的明确偏好。人工偏好数据使我们能够量化自动评分在多大程度上可以再现各种下游摘要任务中的偏好排名。我们发现,虽然自动指标在较小的样本量下是稳定的,但只有某些自动指标能够根据人类偏好适度预测模型的胜率。

关键词

引用

@article{arxiv.2402.18756,
  title  = {How Much Annotation is Needed to Compare Summarization Models?},
  author = {Chantal Shaib and Joe Barrow and Alexa F. Siu and Byron C. Wallace and Ani Nenkova},
  journal= {arXiv preprint arXiv:2402.18756},
  year   = {2024}
}

备注

Preprint