如何寻找强摘要连贯性度量?摘要连贯性度量评估的工具箱与对比研究
计算与语言
2022-09-16 v2
摘要
自动评估摘要的连贯性对于实现高性价比的摘要器评估以及通过筛选高分候选摘要来改进连贯性具有重要意义。尽管已提出许多不同方法来建模摘要连贯性,但它们常使用不一致的数据集和指标进行评估。这使得难以理解它们的相对性能并明确朝向更好摘要连贯性建模的推进方向。本工作中,我们在公平环境下对各种摘要连贯性建模方法进行大规模调研。此外,我们引入两种新颖的分析度量——系统内相关性和偏置矩阵,有助于识别连贯性度量中的偏置,并针对系统级混杂因素提供鲁棒性。虽然当前可用的自动连贯性度量均无法跨所有评估指标为系统摘要分配可靠的连贯性分数,但在自监督任务上微调的大规模语言模型展现出有前景的结果,只要微调考虑到它们需要跨不同摘要长度进行泛化。
引用
@article{arxiv.2209.06517,
title = {How to Find Strong Summary Coherence Measures? A Toolbox and a Comparative Study for Summary Coherence Measure Evaluation},
author = {Julius Steen and Katja Markert},
journal= {arXiv preprint arXiv:2209.06517},
year = {2022}
}
备注
Accepted at COLING2022. Edited to correct differences to COLING version caused by arxiv package versions