DECK:用于提升文本抑郁检测BERT模型可解释性与泛化性的行为测试
计算与语言
2022-09-13 v1
摘要
能从文本中准确检测抑郁症的模型是应对大流行后心理健康危机的重要工具。基于BERT的分类器因其前景良好的性能和开箱即用的可用性,成为该任务的理想候选。然而,这些模型存在性能不一致和泛化能力差的问题。本文引入DECK(DEpression ChecKlist,抑郁检查表),即抑郁专用的模型行为测试,可提升BERT分类器在抑郁领域中的可解释性并改善泛化性。我们创建23项测试,在三个数据集(两个基于Twitter,一个基于临床访谈)上评估BERT、RoBERTa和ALBERT抑郁分类器。评估表明这些模型:1)对文本中某些性别敏感变化具有鲁棒性;2)依赖于抑郁语言标记中第一人称代词使用增加这一重要特征;3)未能检测包括自杀意念在内的其他一些抑郁症状。我们还证明DECK测试可用于在训练数据中融入症状特定信息,并一致地改善所有三种BERT模型的泛化性,分布外F1分数提升高达53.93%。
引用
@article{arxiv.2209.05286,
title = {DECK: Behavioral Tests to Improve Interpretability and Generalizability of BERT Models Detecting Depression from Text},
author = {Jekaterina Novikova and Ksenia Shkaruta},
journal= {arXiv preprint arXiv:2209.05286},
year = {2022}
}