中文

一种用于抽取式播客摘要的两阶段方法

计算与语言 2020-11-18 v1

摘要

播客摘要不同于新闻、专利和科学论文等其他数据格式的摘要,因为播客通常更长、更具对话性、更口语化,并且充满赞助和广告信息,这给现有模型带来了巨大挑战。在本文中,我们专注于抽取式播客摘要,并提出了一种两阶段方法:句子选择和 seq2seq 学习。具体而言,我们首先从嘈杂的长播客转录文本中选择重要句子。该选择基于句子与参考文本的相似度以减少冗余,以及相关的潜在主题以保留语义。然后将所选句子输入预训练的编码器-解码器框架以生成摘要。我们的方法在基于 ROUGE 的度量标准和人工评估方面均取得了有前景的结果。

关键词

引用

@article{arxiv.2011.08291,
  title  = {A Two-Phase Approach for Abstractive Podcast Summarization},
  author = {Chujie Zheng and Kunpeng Zhang and Harry Jiannan Wang and Ling Fan},
  journal= {arXiv preprint arXiv:2011.08291},
  year   = {2020}
}

备注

TREC 2020 Podcasts Track