基于语音与元数据多模态融合的年龄组分类
计算与语言
2018-03-05 v1 声音
音频与语音处理
摘要
儿童在电视观众中占有相当大的比例,为他们定制体验是值得的。然而,识别观众中的儿童是一项具有挑战性的任务。从语音指令中识别性别和年龄是一个被充分研究的问题,但当话语通常仅持续几秒时,要获得良好的准确率仍非常困难。我们展示了一种结合话语与用户元数据的新方法的初步研究。具体而言,我们在不同数据子集上开发了不同机器学习技术的集成,以改进儿童检测。我们的初步结果显示,相对于基线有 9.2% 的绝对提升,从而达到了最先进的性能。
引用
@article{arxiv.1803.00721,
title = {Age Group Classification with Speech and Metadata Multimodality Fusion},
author = {Denys Katerenchuk},
journal= {arXiv preprint arXiv:1803.00721},
year = {2018}
}