PSI-Bench:面向抑郁症患者模拟器的临床扎根与可解释评估
计算与语言
2026-04-29 v1 人工智能
摘要
患者模拟器通过提供对复杂和敏感患者交互的可扩展暴露,在心理健康训练中正获得越来越多的关注。模拟抑郁症患者尤其具有挑战性,因为安全约束和高患者变异性使模拟复杂化,并凸显了对能捕捉多样且真实患者行为的模拟器的需求。然而,现有的评估严重依赖于提示词规范不明确的 LLM 评判器,且未评估行为多样性。我们引入了 PSI-Bench,一个自动评估框架,提供在轮次级、对话级和群体级维度上对抑郁症患者模拟器行为的可解释、临床扎根的诊断。使用 PSI-Bench,我们在两个模拟器框架中对七个 LLM 进行了基准测试,发现模拟器产生过长、词汇多样的回复,表现出变异性降低,过快地化解情绪,并遵循统一的从负到正的轨迹。我们还表明,模拟器框架对保真度的影响大于模型规模。一项人类研究的结果表明,我们的基准与专家判断高度一致。我们的工作揭示了当前抑郁症患者模拟器的关键局限性,并提供了一个可解释、可扩展的基准来指导未来的模拟器设计和评估。
引用
@article{arxiv.2604.25840,
title = {PSI-Bench: Towards Clinically Grounded and Interpretable Evaluation of Depression Patient Simulators},
author = {Nguyen Khoi Hoang and Shuhaib Mehri and Tse-An Hsu and Yi-Jyun Sun and Quynh Xuan Nguyen Truong and Khoa D Doan and Dilek Hakkani-Tür},
journal= {arXiv preprint arXiv:2604.25840},
year = {2026}
}