中文

OpinSummEval:重新审视观点摘要的自动评测

计算与语言 2023-11-14 v2 人工智能

摘要

观点摘要因其对方面与情感的独特关注而区别于其他摘要任务。尽管ROUGE等某些自动评测方法已广受欢迎,我们发现它们作为评估观点摘要质量的指标并不可靠。本文提出OpinSummEval,一个包含人类判断与14个观点摘要模型输出的数据集。我们进一步探究24个自动指标与四个维度上人类评分的相关性。结果表明,基于神经网络的指标总体优于非神经指标。然而,即便构建于BART与GPT-3/3.5等强大骨干之上的指标,也未在所有维度上保持良好相关,凸显观点摘要自动评测方法亟需进展。代码与数据公开于 https://github.com/A-Chicharito-S/OpinSummEval/tree/main。

关键词

引用

@article{arxiv.2310.18122,
  title  = {OpinSummEval: Revisiting Automated Evaluation for Opinion Summarization},
  author = {Yuchen Shen and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2310.18122},
  year   = {2023}
}

备注

preprint, included 2 more metrics compared with the previous submission