语音表征学习:基于单视图、多视图与多任务方法的双向编码器学习
音频与语音处理
2023-08-02 v1 人工智能
计算与语言
摘要
本论文关注于时间与空间上序列数据的表征学习,旨在利用所学表征改进下游序列预测任务。监督学习一直是训练深度神经网络以学习良好序列表征的最主流方法。然而,扩展监督学习的一个限制因素是缺乏足够的标注数据。受此挑战启发,探索能够利用大量无标注与弱标注数据以及额外数据模态的表征学习方法十分自然。我描述了我对语音数据表征学习的广泛研究。与大多数聚焦于单一学习设定下的工作不同,本论文研究了多种设定:带辅助损失的监督学习、无监督学习、半监督学习以及多视图学习。除不同的学习问题外,我还探索了多种表征学习方法。尽管我聚焦于语音数据,本论文所描述的方法亦可应用于其他领域。总体而言,表征学习领域正快速发展。语音相关任务的SOTA结果通常基于用大规模自监督学习预训练的Transformer,其旨在学习有益于多个下游任务的通用表征。自2020年以来,大规模预训练已成为取得良好性能的事实标准选择。这篇迟交的论文无意总结并与最新的语音表征学习结果进行比较;相反,它呈现了Transformer时代之前关于语音表征学习的独特研究,涵盖了多种学习设定。本论文中的部分发现至今仍具价值。
引用
@article{arxiv.2308.00129,
title = {Speech representation learning: Learning bidirectional encoders with single-view, multi-view, and multi-task methods},
author = {Qingming Tang},
journal= {arXiv preprint arXiv:2308.00129},
year = {2023}
}