StreamHover:直播转录文本的摘要与标注
计算与语言
2021-09-14 v1
摘要
随着直播广播的爆发式增长,迫切需要有新的摘要技术,使我们能够创建流媒体内容的预览并挖掘这一知识宝库。然而,由于口语的非正式性,该问题并非易事。此外,用于转录摘要所必需的标注数据集一直短缺。在本文中,我们提出 StreamHover,一个用于标注与摘要直播转录文本的框架。我们的基准数据集总计超过 500 小时视频,标注了抽取式与生成式摘要,规模显著大于现有标注语料。我们探索了一种神经抽取式摘要模型,其利用向量量化变分自编码器学习口语话语的潜在向量表示,并从转录文本中识别显著话语以形成摘要。我们表明,我们的模型泛化性更好,且相较强基线提升了性能。本研究结果为未来改进摘要方案以实现高效浏览直播的研究提供了途径。
引用
@article{arxiv.2109.05160,
title = {StreamHover: Livestream Transcript Summarization and Annotation},
author = {Sangwoo Cho and Franck Dernoncourt and Tim Ganter and Trung Bui and Nedim Lipka and Walter Chang and Hailin Jin and Jonathan Brandt and Hassan Foroosh and Fei Liu},
journal= {arXiv preprint arXiv:2109.05160},
year = {2021}
}
备注
EMNLP 2021 (Long Paper)