论自动化指标对文本生成系统的有效性
计算与语言
2022-10-25 v1 人工智能
摘要
文本生成领域的一大挑战是评估,因为我们缺乏可借以提取评估活动指南的健全理论。本文中,我们提出构建此类理论的第一步,其融合了不同不确定性来源,如不完善的自动化指标和规模不足的测试集。该理论具有实际应用价值,例如确定在给定设定下可靠区分一组文本生成系统性能所需的样本数量。我们在 WMT 21 与 Spot-The-Bot 评估数据上展示了该理论的应用,并概述如何借助它改进评估协议,以提升评估结果在可靠性、鲁棒性与显著性方面的表现。
引用
@article{arxiv.2210.13025,
title = {On the Effectiveness of Automated Metrics for Text Generation Systems},
author = {Pius von Däniken and Jan Deriu and Don Tuggener and Mark Cieliebak},
journal= {arXiv preprint arXiv:2210.13025},
year = {2022}
}