利用声学线索与副语言嵌入从语音中检测表达
计算与语言
2019-07-02 v1 机器学习
声音
音频与语音处理
摘要
数百万人每天向Siri等数字助理求助,查询信息、拨打电话、寻求协助等。期望此类助理能理解用户查询的意图。从简短孤立语句中检测查询意图是困难任务。意图并非总能从语音识别转录文本获得。转录驱动方法可解读说了什么,却未能承认如何说的,从而可能忽略语音中存在的表达。我们的工作探究系统能否利用声学与副语言嵌入可靠检测查询中的语音表达。结果显示,相较基于词袋的系统,所提方法相对等错误率(EER)降低60%,证实表达显著由声音属性而非纯词汇表征。加入情感嵌入相较声学嵌入进一步相对降低EER达30%,展示了情感在表达性语音中的相关性。
引用
@article{arxiv.1907.00112,
title = {Leveraging Acoustic Cues and Paralinguistic Embeddings to Detect Expression from Voice},
author = {Vikramjit Mitra and Sue Booker and Erik Marchi and David Scott Farrar and Ute Dorothea Peitz and Bridget Cheng and Ermine Teves and Anuj Mehta and Devang Naik},
journal= {arXiv preprint arXiv:1907.00112},
year = {2019}
}
备注
5 pages, 6 figures