中文

一种用于语音摘要的带增强特征的有效上下文语言建模框架

计算与语言 2020-06-03 v1

摘要

海量的与语音信息相关的多媒体正迫切驱动着开发高效且有效的自动摘要方法的需求。为此,我们已看到将基于监督深度神经网络的方法应用于抽取式语音摘要取得了快速进展。最近,Bidirectional Encoder Representations from Transformers(BERT)模型被提出,并在许多自然语言处理(NLP)任务(如问答和语言理解)上取得了破纪录的成功。有鉴于此,本文中对最先进的基于 BERT 的语音摘要模型进行语境化与增强,其贡献至少有以下三方面。首先,我们探索将置信度分数纳入句子表示,以考察这种尝试是否有助于缓解不完美自动语音识别(ASR)带来的负面影响。其次,我们还将从 BERT 获得的句子嵌入与额外的结构和语言学特征(如句子位置和逆文档频率(IDF)统计)相增强。最后,我们在一个基准数据集上验证了所提方法的有效性,并与几种经典且著名的语音摘要方法进行比较。

关键词

引用

@article{arxiv.2006.01189,
  title  = {An Effective Contextual Language Modeling Framework for Speech Summarization with Augmented Features},
  author = {Shi-Yan Weng and Tien-Hong Lo and Berlin Chen},
  journal= {arXiv preprint arXiv:2006.01189},
  year   = {2020}
}

备注

Accepted by EUSIPCO 2020