中文

基于深度神经网络的无监督听觉和语义趋同模型

计算与语言 2023-12-27 v1 声音 音频与语音处理

摘要

说话者倾向于参与适应性行为,即趋同,当他们与对话者在说话的各个方面变得相似时。我们提出了一个无监督深度学习框架,从文本特征中推导出有意义的表示,以开发语义趋同。我们通过使用BERT模型的不同变体(DistilBERT和XLM-RoBERTa)和Google的通用句子编码器(USE)嵌入在两个人类-人类(HH)语料库(Fisher语料库英语第1部分,哥伦比亚游戏语料库)和一个人类-机器(HM)语料库(语音助手对话语料库(VACC))上提取特征来研究模型的性能。除了语义特征,我们还训练了基于DNN的模型,利用两种听觉嵌入(TRIplet Loss网络(TRILL)向量,低级描述符(LLD)特征)和两种分析单位(间隔单元和话轮)。结果表明,语义趋同可以用我们的模型评估,模型可以区分HH和HM交互,并且用于提取声学特征的两种分析单位提供了可比较的结果。

关键词

引用

@article{arxiv.2312.15098,
  title  = {Unsupervised Auditory and Semantic Entrainment Models with Deep Neural Networks},
  author = {Jay Kejriwal and Stefan Benus and Lina M. Rojas-Barahona},
  journal= {arXiv preprint arXiv:2312.15098},
  year   = {2023}
}

备注

Interspeech2023