中文

GPT-4 在诊疗抑郁症评估中的表现:基于大语言模型的试点研究

计算与语言 2025-01-03 v1 人工智能

摘要

抑郁症已影响全球数百万人,成为最流行的精神疾病之一。早期精神障碍检测可为公共卫生机构带来成本节省,并避免其他主要伴随疾病的发生。此外,专业人员短缺是一个关键问题,因为临床抑郁诊断高度依赖专家专业人员且耗时。在本研究中,我们探索了基于访谈记录分析的 GPT-4 用于临床抑郁评估。我们检验模型将患者访谈分类为二元类别:抑郁和非抑郁。进行比较分析,考虑提示复杂度(例如使用简单和复杂提示)以及不同的温度设置,以评估提示复杂度和随机性对模型性能的影响。结果表明,GPT-4 在不同配置下的准确率和 F1 分数存在相当大的波动,最佳性能在较低温度值(0.0-0.2)下使用复杂提示时观察到。然而,超过特定阈值(温度 >= 0.3)后,随机性与性能之间的关系变得不可预测,削弱了提示复杂度的收益。这些发现表明,尽管 GPT-4 在临床评估方面显示出前景,但提示的配置和模型参数需要精心校准才能确保一致的结果。这一初步研究为理解大语言模型之间提示工程的动态关系提供了见解,为未来在临床环境中开发基于 AI 的工具提供了启发。

关键词

引用

@article{arxiv.2501.00199,
  title  = {GPT-4 on Clinic Depression Assessment: An LLM-Based Pilot Study},
  author = {Giuliano Lorenzoni and Pedro Elkind Velmovitsky and Paulo Alencar and Donald Cowan},
  journal= {arXiv preprint arXiv:2501.00199},
  year   = {2025}
}