优化语音输入长度用于听者无关的抑郁分类
计算与语言
2025-01-03 v1 音频与语音处理
摘要
基于语音的抑郁分类机器学习模型为健康护理应用提供了前景。尽管存在针对抑郁分类的研究工作,但关于语音输入长度对模型性能的影响仍鲜有了解。我们分析了使用来自人机健康筛查应用程序的超过 1400 小时的语音数据进行的听者无关抑郁分类结果。我们按响应输入长度考察了两种 NLP 系统的性能,这两种系统的整体性能不同。两种系统的结果都表明,性能取决于自然长度、已消耗长度以及响应在会话中出现的顺序。两种系统共享一个最小长度阈值,但在响应饱和阈值方面存在差异,后者对于性能更好的系统更高。在饱和点,提出新问题给听者比继续当前响应更好。这些结果以及额外报告的实验结果表明,如何设计应用程序以更好地获取和处理最佳输入长度以用于抑郁分类具有重要意义。
引用
@article{arxiv.2501.00608,
title = {Optimizing Speech-Input Length for Speaker-Independent Depression Classification},
author = {Tomasz Rutowski and Amir Harati and Yang Lu and Elizabeth Shriberg},
journal= {arXiv preprint arXiv:2501.00608},
year = {2025}
}