中文

PsychEthicsBench:评估大型语言模型是否符合澳大利亚心理健康伦理

计算与语言 2026-01-08 v1

摘要

大型语言模型(LLM)在心理健康应用中的日益整合,迫切需要对专业安全一致性进行稳健评估的框架。当前的评估方法主要依赖于基于拒绝的安全信号,这为临床实践中所需的细微行为提供的洞察有限。在心理健康领域,临床上不充分的拒绝可能被视为缺乏同理心,并阻碍求助行为。为弥补这一空白,我们超越了以拒绝为中心的指标,引入了\texttt{PsychEthicsBench}——首个基于澳大利亚心理学和精神病学指南的原则性基准,旨在通过具有细粒度伦理性标注的多项选择和开放式任务来评估LLM的伦理知识和行为反应。对14个模型的实证结果表明,拒绝率是伦理行为的不良指标,揭示了安全触发与临床适宜性之间的显著分歧。值得注意的是,我们发现特定领域的微调可能降低伦理鲁棒性,因为几个专门模型在伦理一致性上表现不如其基础骨干模型。PsychEthicsBench为LLM在心理健康领域的系统性、基于管辖区的评估奠定了基础,鼓励在该领域进行更负责任的开发。

关键词

引用

@article{arxiv.2601.03578,
  title  = {PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics},
  author = {Yaling Shen and Stephanie Fong and Yiwen Jiang and Zimu Wang and Feilong Tang and Qingyang Xu and Xiangyu Zhao and Zhongxing Xu and Jiahe Liu and Jinpeng Hu and Dominic Dwyer and Zongyuan Ge},
  journal= {arXiv preprint arXiv:2601.03578},
  year   = {2026}
}

备注

17 pages