MindGuard:面向多轮心理健康支持的警戒分类器
人工智能
2026-02-03 v1
摘要
大型语言模型正在用于心理健康支持,但其对话连贯性本身并不确保临床适当性。现有的通用安全措施往往无法区分治疗性披露和真正的临床危机,导致安全失效。为此,我们引入一种临床导师的风险分类法,与博士级心理学家合作,识别可操作性伤害(如自伤和伤害他人),同时保留对安全非危机治疗内容的空间。我们发布了MindGuard-testset,这是一个来自真实世界多轮对话的数据集,由临床专家在每一轮对话中进行注释。使用通过受控双主体设置生成的合成对话,我们训练了MindGuard,一组轻量级安全分类器(具有4B和8B参数)。我们的分类器在高召回率 operating point 下降低了误报率,当与临床语言模型配合使用时,可在对抗性多轮交互中实现更低的攻击成功率和有害参与率。我们发布了所有模型和人类评估数据。
引用
@article{arxiv.2602.00950,
title = {MindGuard: Guardrail Classifiers for Multi-Turn Mental Health Support},
author = {António Farinhas and Nuno M. Guerreiro and José Pombal and Pedro Henrique Martins and Laura Melton and Alex Conway and Cara Dochat and Maya D'Eon and Ricardo Rei},
journal= {arXiv preprint arXiv:2602.00950},
year = {2026}
}