中文

CUED_speech 参加 TREC 2020 播客摘要赛道

计算与语言 2021-01-14 v2

摘要

在本文中,我们描述了针对 TREC 2020 播客摘要挑战的方法。给定一集带有转录文本的播客,目标是生成捕捉内容中最重要的信息的摘要。我们的方法包括两步:(1)利用层次化模型的注意力过滤转录文本中冗余或信息量较低的句子;(2)应用在播客数据上以序列级奖励函数微调的最先进文本摘要系统(BART)。此外,我们为提交的运行进行了三个和九个模型的集成。我们还将 BART 模型在播客数据上微调作为基线。NIST 的人工评估显示,我们的最佳提交在 EGFB 量表上取得 1.777 分,而创作者提供描述的得分为 1.291。我们的系统在 TREC2020 播客赛道的 Spotify 播客摘要挑战中于人工和自动评估中均获胜。

关键词

引用

@article{arxiv.2012.02535,
  title  = {CUED_speech at TREC 2020 Podcast Summarisation Track},
  author = {Potsawee Manakul and Mark Gales},
  journal= {arXiv preprint arXiv:2012.02535},
  year   = {2021}
}

备注

TREC 2020