中文

基于三元组增强上下文网络的无监督语音表征学习用于行为建模

音频与语音处理 2021-04-09 v1 人工智能 声音

摘要

语音编码了与人类行为相关的丰富信息,并已用于多种自动化行为识别任务。然而,从语音中提取行为信息仍具挑战性,部分原因在于特定行为模式出现频率往往较低导致训练数据资源不足。此外,有监督行为建模通常依赖于特定领域的构念定义及相应人工标注数据,使得跨领域泛化困难。本文中,我们利用交互中人类行为的平稳特性,提出一种以无监督方式从语音捕获行为信息的表征学习方法。我们假设邻近语音片段共享相同行为语境,因而映射到相似的内在行为表征。我们提出基于编码器-解码器的深度上下文网络(DCN)以及三元组增强 DCN(TE-DCN)框架,以捕获行为语境并导出流形表征,其中具有相似行为的语音帧彼此接近,而不同行为的帧保持较大距离。模型在电影音频数据上训练,并在多个不同领域验证,包括夫妻治疗语料库及其他公开收集数据(如单口喜剧)。凭借令人鼓舞的结果,我们所提框架展示了跨领域行为建模中无监督学习的可行性。

关键词

引用

@article{arxiv.2104.03899,
  title  = {Unsupervised Speech Representation Learning for Behavior Modeling using Triplet Enhanced Contextualized Networks},
  author = {Haoqi Li and Brian Baucom and Shrikanth Narayanan and Panayiotis Georgiou},
  journal= {arXiv preprint arXiv:2104.03899},
  year   = {2021}
}