临床访谈中PTSD的检测:NLP方法与大型语言模型的比较分析
计算与语言
2026-01-08 v3 人工智能
机器学习
摘要
创伤后应激障碍(PTSD)在临床环境中常被低诊断,为自动化检测识别患者提供了机会。本研究评估了从临床访谈记录中检测PTSD的自然语言处理方法。我们比较了通用和面向精神健康的变换模型(BERT/RoBERTa)、基于嵌入的方法(SentenceBERT/LLaMA)以及大型语言模型提示策略(zero-shot/few-shot/chain-of-thought),使用DAIC-WOZ数据集。领域特定的端到端模型显著优于通用模型(Mental-RoBERTa AUPRC=0.675±0.084 vs. RoBERTa-base 0.599±0.145)。SentenceBERT嵌入与神经网络实现了最佳整体性能(AUPRC=0.758±0.128)。基于DSM-5标准的few-shot提示在仅提供两个示例时达到竞争性结果(AUPRC=0.737)。性能在症状严重程度和伴随抑郁状态方差显著,严重PTSD病例和伴随抑郁患者检测准确率更高。我们的发现凸显了领域适应嵌入和大型语言模型用于可扩展筛查的潜力,同时强调了对细粒度表现形式检测的需求,为开发临床可行的AI工具进行PTSD评估提供了洞见。
引用
@article{arxiv.2504.01216,
title = {Detecting PTSD in Clinical Interviews: A Comparative Analysis of NLP Methods and Large Language Models},
author = {Feng Chen and Dror Ben-Zeev and Gillian Sparks and Arya Kadakia and Trevor Cohen},
journal= {arXiv preprint arXiv:2504.01216},
year = {2026}
}