面向同步序列生成的统一段到段框架
计算与语言
2023-12-01 v4 人工智能
声音
音频与语音处理
摘要
同步序列生成是实时场景中的关键任务,如流式语音识别、同步机器翻译与同步语音翻译,其目标序列在接收源序列的同时生成。以低延迟实现高质量生成的关键在于识别生成的最优时刻,这通过学习源序列与目标序列间的映射来完成。然而,现有方法常依赖针对不同类型序列的任务特定启发式,限制了模型自适应学习源-目标映射的能力,并阻碍了对各类同步任务的多任务学习探索。本文提出一种面向同步序列生成的统一段到段框架(Seg2Seg),以自适应且统一的方式学习映射。在同步生成过程中,模型交替等待源段与生成目标段,使段成为源与目标间的自然桥梁。为此,Seg2Seg 引入潜段作为源到目标的枢纽,并通过所提出的期望训练探索所有潜在源-目标映射,从而学习生成的最优时刻。在多个同步生成任务上的实验表明,Seg2Seg 取得了最先进的性能,并在各任务间展现出更好的通用性。
引用
@article{arxiv.2310.17940,
title = {Unified Segment-to-Segment Framework for Simultaneous Sequence Generation},
author = {Shaolei Zhang and Yang Feng},
journal= {arXiv preprint arXiv:2310.17940},
year = {2023}
}
备注
Accepted at NeurIPS 2023