说话人嵌入与 temporal context 在抑郁检测中的重要性
计算机与社会
2021-07-30 v1 机器学习
声音
音频与语音处理
摘要
近年来,从语音中检测抑郁症引起了大量关注。然而,说话人特定信息在抑郁检测中的重要性尚未被探索。在本工作中,我们分析了说话人嵌入对于从语音中检测抑郁症任务的重要性。实验结果表明,说话人嵌入提供了重要线索,以实现抑郁检测的当前最优性能。我们还表明,将携带互补信息的常规 OpenSMILE 和 COVAREP 特征与说话人嵌入相结合,进一步提升了抑郁检测性能。本文还分析了 temporal context 在训练用于抑郁检测的深度学习模型中的重要性。
引用
@article{arxiv.2107.13969,
title = {Significance of Speaker Embeddings and Temporal Context for Depression Detection},
author = {Sri Harsha Dumpala and Sebastian Rodriguez and Sheri Rempel and Rudolf Uher and Sageev Oore},
journal= {arXiv preprint arXiv:2107.13969},
year = {2021}
}