分析 LLM 推理以揭露心理健康污名
计算与语言
2026-04-29 v1 人工智能
摘要
尽管大语言模型(LLMs)正越来越多地被用于心理健康应用,但最近的研究表明它们对具有心理条件的个体可能表现出污名化倾向。现有的污名评估主要依赖多选题(MCQs),无法捕捉模型底层逻辑中嵌入的偏见。在本文中,我们分析了 LLM 中间推理步骤,以揭露隐藏的污名化语言及其背后的内部理由。我们利用临床专业知识来分类常见的污名化语言模式,针对具有心理条件的个体,并使用此框架识别和标记有问题的陈述。此外,我们对这些陈述进行严重程度评分,区分显性偏见和更微妙、不那么直接有害的偏见。为扩大推理范围并捕捉更广泛的模式,我们还通过纳入额外的心理条件来扩展现有的心理健康污名基准。我们的发现表明,评估模型推理不仅比传统的 MCQ 方法暴露的污名更多,而且有助于识别 LLM 逻辑中的缺陷及其对心理健康条件的理解。
引用
@article{arxiv.2604.25053,
title = {Analyzing LLM Reasoning to Uncover Mental Health Stigma},
author = {Sreehari Sankar and Aliakbar Nafar and Mona Barman and Hannah K. Heitz and Ashwin Kumar and Pouria Tohidi and Dailun Li and Danish Hussain and Russell DuBois and Hamed Hasheminia and Farshad Majzoubi},
journal= {arXiv preprint arXiv:2604.25053},
year = {2026}
}