通过聆听自举语义:口语句子嵌入的无监督学习
计算与语言
2022-10-25 v1 声音
音频与语音处理
摘要
直接从语音信号中诱导语义表示是一项极具挑战性的任务,但在语音挖掘与口语理解中有诸多有用应用。本研究致力于口语话语语义表示的无监督学习。通过将语音信号转换为声学单元发现所生成的隐单元,我们提出 WavEmbed,一种从语音的稠密表示预测隐单元的多模态序列自编码器。其次,我们还提出 S-HuBERT,通过知识蒸馏诱导语义,其中句子嵌入模型先在隐单元上训练,再通过对比学习将其知识传递给语音编码器。性能最佳的模型在不依赖任何标签或转写文本的情况下,与人类判断达到中等程度相关性(0.5~0.6)。此外,这些模型也可轻易扩展以利用语音的文本转写来学习与人类标注强相关的更优语音嵌入。我们提出的方法适用于开发用于语音挖掘、索引与检索的纯数据驱动系统。
引用
@article{arxiv.2210.12857,
title = {Bootstrapping meaning through listening: Unsupervised learning of spoken sentence embeddings},
author = {Jian Zhu and Zuoyu Tian and Yadong Liu and Cong Zhang and Chia-wen Lo},
journal= {arXiv preprint arXiv:2210.12857},
year = {2022}
}
备注
Findings of EMNLP 2022