中文

PSI-Bench:面向抑郁症患者模拟器的临床扎根与可解释评估

计算与语言 2026-04-29 v1 人工智能

摘要

患者模拟器通过提供对复杂和敏感患者交互的可扩展暴露,在心理健康训练中正获得越来越多的关注。模拟抑郁症患者尤其具有挑战性,因为安全约束和高患者变异性使模拟复杂化,并凸显了对能捕捉多样且真实患者行为的模拟器的需求。然而,现有的评估严重依赖于提示词规范不明确的 LLM 评判器,且未评估行为多样性。我们引入了 PSI-Bench,一个自动评估框架,提供在轮次级、对话级和群体级维度上对抑郁症患者模拟器行为的可解释、临床扎根的诊断。使用 PSI-Bench,我们在两个模拟器框架中对七个 LLM 进行了基准测试,发现模拟器产生过长、词汇多样的回复,表现出变异性降低,过快地化解情绪,并遵循统一的从负到正的轨迹。我们还表明,模拟器框架对保真度的影响大于模型规模。一项人类研究的结果表明,我们的基准与专家判断高度一致。我们的工作揭示了当前抑郁症患者模拟器的关键局限性,并提供了一个可解释、可扩展的基准来指导未来的模拟器设计和评估。

关键词

引用

@article{arxiv.2604.25840,
  title  = {PSI-Bench: Towards Clinically Grounded and Interpretable Evaluation of Depression Patient Simulators},
  author = {Nguyen Khoi Hoang and Shuhaib Mehri and Tse-An Hsu and Yi-Jyun Sun and Quynh Xuan Nguyen Truong and Khoa D Doan and Dilek Hakkani-Tür},
  journal= {arXiv preprint arXiv:2604.25840},
  year   = {2026}
}