面向端到端语音到文本摘要
计算与语言
2023-06-12 v1 人工智能
机器学习
音频与语音处理
摘要
语音到文本(S2T)摘要是一种节省时间的技术,用于过滤和跟进每天在线发布的广播新闻。深度学习带来具有惊人文本生成能力的大语言模型(LLM),使研究焦点转向生成文档内容的释义紧凑版本(即抽象摘要)的摘要系统。S2T 抽象摘要的端到端(E2E)建模是一种有前景的方法,能够提供利用非语言和声学信息生成丰富潜在表示的可能,而非像级联系统那样仅使用自动生成转录文本中的语言信息。然而,关于该任务 E2E 建模的少量文献未能探索不同领域,即广播新闻——这是一个具有挑战性的领域,每天向用户呈现大量且多样化的数据。我们针对一个法语广播新闻语料库,分别使用级联系统和 E2E 系统对 S2T 摘要进行建模。我们的新型 E2E 模型通过借助预训练 T2T 摘要器的迁移学习来利用外部数据。实验表明,我们的级联和 E2E 抽象摘要器均强于抽取式基线。然而,E2E 模型的性能仍落后于级联模型,我们对此进行了包含缩小差距未来方向的大量分析。
引用
@article{arxiv.2306.05432,
title = {Towards End-to-end Speech-to-text Summarization},
author = {Raul Monteiro and Diogo Pernes},
journal= {arXiv preprint arXiv:2306.05432},
year = {2023}
}
备注
Accepted to the 26th International Conference of Text, Speech and Dialogue (TSD2023)