机器生成推理与 PHQ-9 标签的系统评估:大语言模型在抑郁检测中的应用
计算与语言
2025-05-26 v1 机器学习
摘要
最近的研究利用大语言模型 (LLM) 进行早期精神健康检测,如抑郁症,常优化于机器生成数据,但其检测可能存在未知的弱点。此外,除了有限的人类验证之外,对这些生成语料库未应用质量控制。我们的目标是系统评估 LLM 推理并揭示潜在弱点。为此,我们首先提供对检测与解释中机器生成推理的系统评估。随后,我们利用模型的推理能力来探索增强性能的缓解策略。具体而言,我们做了以下几件事:A. 设计一种 LLM 指令策略,允许对检测进行系统性分析,通过将任务分解为多个子任务来实现。B. 设计对比式少样本和链式思维提示,通过选择检测推理中典型的正负示例来实现。C. 对第一步中识别的子任务进行人工标注并进行性能评估。D. 从少样本生成中识别出具有理想逻辑推理的人类偏好检测,并用于探索不同的优化策略。在...(摘要文本在原文中被截断,此处保留原有省略号)
引用
@article{arxiv.2505.17119,
title = {Systematic Evaluation of Machine-Generated Reasoning and PHQ-9 Labeling for Depression Detection Using Large Language Models},
author = {Zongru Shao and Xin Wang and Zhanyang Liu and Chenhan Wang and K. P. Subbalakshmi},
journal= {arXiv preprint arXiv:2505.17119},
year = {2025}
}
备注
8 pages without references