中文

论文复述:语音转文本生成中的插值数据增强

计算与语言 2024-06-25 v1 音频与语音处理

摘要

语音转文本(S2T)生成系统在低资源场景下常面临数据标注不足的挑战,主要由于缺乏大量标注数据集。一种新兴解决方案是通过插值输入和标签构建虚拟训练样本,这一技术在其他领域已显著提升了系统的泛化能力。尽管存在潜力,但该技术在S2T任务中的应用仍鲜有探索。本文深入研究了插值数据增强的实用性,围绕若干关键问题展开。我们的发现表明,在插值数据增强中采用合适的策略,可在多样化的任务、架构和数据规模下显著提升性能,为资源受限环境下更稳健的S2T系统提供了可行的途径。

关键词

引用

@article{arxiv.2406.15846,
  title  = {Revisiting Interpolation Augmentation for Speech-to-Text Generation},
  author = {Chen Xu and Jie Wang and Xiaoqian Liu and Qianqian Dong and Chunliang Zhang and Tong Xiao and Jingbo Zhu and Dapeng Man and Wu Yang},
  journal= {arXiv preprint arXiv:2406.15846},
  year   = {2024}
}

备注

ACL 2024 Findings