我们能信任文本摘要中不确定性估计方法的性能评估吗?
计算与语言
2024-10-10 v2 机器学习
摘要
文本摘要是关键的自然语言生成任务,在各个领域都至关重要。然而,在风险关键型应用中,特别是涉及人在回路决策的应用中,不准确摘要的高成本引发了对文本摘要不确定性估计评估方法可靠性的担忧。这种担忧源于不确定性模型指标对多样化且可能相互冲突的自然语言生成指标的依赖性。为解决此问题,我们引入了一个全面的文本摘要不确定性估计基准,该基准包含四个维度的31个自然语言生成指标。该基准评估了两个大型语言模型和一个预训练语言模型在三个数据集上的不确定性估计能力,并在适用时结合了人工标注分析。我们还在此基准内评估了14种常见不确定性估计方法的性能。我们的研究结果强调了考虑多个不相关的自然语言生成指标和多样化不确定性估计方法的重要性,以确保对文本摘要不确定性估计技术进行可靠且高效的评估。我们的代码和数据可在 https://github.com/he159ok/Benchmark-of-Uncertainty-Estimation-Methods-in-Text-Summarization 获取。
引用
@article{arxiv.2406.17274,
title = {Can We Trust the Performance Evaluation of Uncertainty Estimation Methods in Text Summarization?},
author = {Jianfeng He and Runing Yang and Linlin Yu and Changbin Li and Ruoxi Jia and Feng Chen and Ming Jin and Chang-Tien Lu},
journal= {arXiv preprint arXiv:2406.17274},
year = {2024}
}
备注
62 pages, 41 figures, 11 tables