中文

关于使用口语训练和评估抑郁风险模型的语料库规模需求

计算与语言 2025-01-03 v1 声音 音频与语音处理

摘要

心理健康风险预测是语音社区中一个不断发展的领域,但许多研究基于小型语料库。本研究在受控研究中说明了测试集和训练集大小的变化如何影响性能。使用包含超过65K个标记数据点的语料库,提供了不同训练/测试大小组合的完全交叉设计的结果。包括两种模型类型:一种基于语言,另一种基于语音声学。两者都使用了该领域当前的方法。还包含了一个年龄不匹配的测试集。结果表明:(1)即使训练集大小较大,低于1K样本的测试集也会产生噪声结果;(2)训练集大小至少需要2K才能获得稳定结果;(3)NLP和声学模型在训练/测试大小变化时表现相似;(4)不匹配的测试集显示出与匹配测试集相同的模式。还讨论了其他因素,包括标签先验、模型强度和预训练、独特说话者以及数据长度。虽然单一研究无法指定确切的大小要求,但结果表明,未来从语音和语言进行心理健康风险预测的研究需要适当大小的训练集和测试集。

关键词

引用

@article{arxiv.2501.00617,
  title  = {Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language},
  author = {Tomek Rutowski and Amir Harati and Elizabeth Shriberg and Yang Lu and Piotr Chlebek and Ricardo Oliveira},
  journal= {arXiv preprint arXiv:2501.00617},
  year   = {2025}
}