迈向无人工参与的德语摘要自动质量评估
计算与语言
2021-05-14 v1
摘要
从组织和财务角度看,使用人工评估大型摘要语料库已被证明是昂贵的。因此,许多自动评估指标被开发出来,以快速且可复现的方式衡量摘要质量。然而,大多数指标仍依赖人工,并需要由语言专家生成的黄金标准摘要。由于BLANC不需要黄金摘要且据称可使用任何底层语言模型,我们考虑将其应用于德语摘要评估。本工作展示了如何将BLANC指标调整到英语以外的语言。我们在一个德语摘要数据集上将BLANC分数与众包及专家评分以及常用自动指标进行比较。我们的结果表明,德语BLANC在评估信息量方面尤为出色。
引用
@article{arxiv.2105.06027,
title = {Towards Human-Free Automatic Quality Evaluation of German Summarization},
author = {Neslihan Iskender and Oleg Vasilyev and Tim Polzehl and John Bohannon and Sebastian Möller},
journal= {arXiv preprint arXiv:2105.06027},
year = {2021}
}
备注
6 pages, 2 figures