一种用于抽取式播客摘要的两阶段方法
计算与语言
2020-11-18 v1
摘要
播客摘要不同于新闻、专利和科学论文等其他数据格式的摘要,因为播客通常更长、更具对话性、更口语化,并且充满赞助和广告信息,这给现有模型带来了巨大挑战。在本文中,我们专注于抽取式播客摘要,并提出了一种两阶段方法:句子选择和 seq2seq 学习。具体而言,我们首先从嘈杂的长播客转录文本中选择重要句子。该选择基于句子与参考文本的相似度以减少冗余,以及相关的潜在主题以保留语义。然后将所选句子输入预训练的编码器-解码器框架以生成摘要。我们的方法在基于 ROUGE 的度量标准和人工评估方面均取得了有前景的结果。
引用
@article{arxiv.2011.08291,
title = {A Two-Phase Approach for Abstractive Podcast Summarization},
author = {Chujie Zheng and Kunpeng Zhang and Harry Jiannan Wang and Ling Fan},
journal= {arXiv preprint arXiv:2011.08291},
year = {2020}
}
备注
TREC 2020 Podcasts Track