语言塑造了大型语言模型中的心理健康评估
计算与语言
2026-03-10 v1
摘要
本研究探讨了大型语言模型(LLM)是否存在跨语言差异的心理健康评估。我们聚焦于中文和英文,检验两个广泛使用的模型(GPT-4o 和 Qwen3)是否因提示语言而系统性地改变心理健康相关评估及下游决策结果。首先,我们评估模型对心理健康污名化的评估倾向,使用多个经过验证的测量尺度捕捉社会污名、自我污名和专业污名。在所有测量指标中,两个模型在中文提示下产生的污名相关响应高于英文提示。其次,我们检验这些差异是否也体现在两种常见的心理健康下游决策任务中。在二元心理健康污名检测任务中,对污名化内容的灵敏度因提示语言而异,在中文提示下表现较低。在抑郁严重程度分类任务中,预测的严重程度也因提示语言而异,中文提示与英文提示相关联,表明系统性地低估了预测严重程度。综上,这些发现表明,语言背景可系统性地塑造 LLM 输出中的评估模式,并在下游任务中移动决策阈值。
引用
@article{arxiv.2603.06910,
title = {Language Shapes Mental Health Evaluations in Large Language Models},
author = {Jiayi Xu and Xiyang Hu},
journal= {arXiv preprint arXiv:2603.06910},
year = {2026}
}