基于声学特征的无监督潜在行为流形学习:audio2behavior
机器学习
2017-01-13 v1 声音
摘要
利用信号处理和机器学习进行行为标注高度依赖于训练数据和行为标签的手动标注。先前研究表明语音信息编码了显著的行为信息,并可用于多种自动化行为识别任务。然而,由于训练数据的稀疏性,加之语音的复杂高维度及其编码的复杂多路信息流,从语音中提取行为信息仍是一项困难任务。本工作中我们利用人类行为的缓慢变化特性。我们假设邻近的语音片段共享相同的行为上下文,从而在潜在空间中共享相似的内在表示。具体而言,我们提出一种深度神经网络(DNN)模型来关联行为上下文,并以无监督方式推导行为流形。我们在夫妻治疗领域评估了所提出的流形,并提供了来自公开可用数据(如单口喜剧)的示例。我们进一步研究了在夫妻治疗领域及电影数据上的训练。结果极为鼓舞人心,有望以无监督方式改进行为量化,并值得在一系列应用中进一步研究。
引用
@article{arxiv.1701.03198,
title = {Unsupervised Latent Behavior Manifold Learning from Acoustic Features: audio2behavior},
author = {Haoqi Li and Brian Baucom and Panayiotis Georgiou},
journal= {arXiv preprint arXiv:1701.03198},
year = {2017}
}
备注
Accepted by ICASSP 2017