评估基于语言的抑郁症检测中的算法偏见:DNN 与 LLM 方法的比较
摘要
本文研究了用于自动化抑郁症检测的基于语言的模型中的算法偏见,重点关注与性别和种族/族裔相关的社会人口统计学差异。将使用基于深度神经网络 (DNN) 的嵌入训练的模型与使用大语言模型 (LLM) 的少样本学习方法进行比较,在来自 Distress Analysis Interview Corpus/Wizard-of-Oz (DAIC-WOZ) 的临床访谈转录文本上评估其性能和公平性。为了减轻偏见,对基于 DNN 的模型应用了公平性感知损失函数,而对 LLM 则探索了使用不同提示框架和样本数量的上下文学习。结果表明,LLM 在抑郁症分类方面优于基于 DNN 的模型,特别是对于代表性不足的群体,如西班牙裔参与者。与基于 DNN 的嵌入相比,LLM 还表现出更低的性别偏见,尽管种族差异仍然存在。在用于减轻基于 DNN 嵌入偏见的公平性感知技术中,最差组别损失旨在最小化表现最差的人口统计组的损失,它在性能和公平性之间取得了更好的平衡。相比之下,公平性正则化损失最小化了所有组的损失,但效果较差。在 LLM 中,带有伦理框架的引导提示有助于在单样本设置中减轻性别偏见。然而,增加样本数量并不会进一步减少差异。对于种族/族裔,无论是提示策略还是在 N-shot 学习中增加 都不能有效减少差异。
引用
@article{arxiv.2509.25795,
title = {Assessing Algorithmic Bias in Language-Based Depression Detection: A Comparison of DNN and LLM Approaches},
author = {Obed Junias and Prajakta Kini and Theodora Chaspari},
journal= {arXiv preprint arXiv:2509.25795},
year = {2026}
}
备注
7 pages, 1 figure. This paper has been accepted to the IEEE-EMBS International Conference on Biomedical and Health Informatics (BHI 2025), Georgia Institute of Technology, Atlanta, Georgia, October 26-29, 2025