从排行榜到实践:摘要系统的骨干表示模型选择与鲁棒性保障
计算与语言
2023-06-21 v1
摘要
学术文献对于如何基于现有研究组件构建最佳的面向客户的摘要系统缺乏充分指导。本文给出若干分析以辅助从流行模型中选择系统骨干;我们发现无论是在自动评测还是人工评测中,BART 均优于 PEGASUS 和 T5。我们还发现,当跨领域应用时,摘要系统的性能显著下降。与此同时,在异质领域上微调的系统在所有领域均表现良好,因而最适合作为广域摘要系统。我们的工作凸显了构建异质领域摘要基准的必要性。我们发现系统输出存在相当大的差异,这只能通过人工评测捕捉,因此不太可能反映于仅含自动评测的标准排行榜中。
引用
@article{arxiv.2306.10555,
title = {Summarization from Leaderboards to Practice: Choosing A Representation Backbone and Ensuring Robustness},
author = {David Demeter and Oshin Agarwal and Simon Ben Igeri and Marko Sterbentz and Neil Molino and John M. Conroy and Ani Nenkova},
journal= {arXiv preprint arXiv:2306.10555},
year = {2023}
}