中文

勿伤于人:通过心理咨询服务中基于人设的客户端模拟攻击揭示LLM的隐藏漏洞

计算与语言 2026-04-07 v1

摘要

大型语言模型(LLM)在心理健康领域的日益使用引发了高风险治疗互动中的安全问题。一个关键挑战是区分治疗性共情与适应不良的确认,其中支持性回应可能在多轮对话中无意中强化有害信念或行为。这一风险在很大程度上被现有的红队测试框架所忽视,这些框架主要关注通用伤害或基于优化的攻击。为了弥补这一空白,我们提出了基于人设的客户端模拟攻击(PCSA),这是首个通过连贯的、基于人设的客户端对话来模拟心理咨询服务中的客户端,以揭示心理安全对齐中漏洞的红队测试框架。在七个通用和心理健康专业LLM上的实验表明,PCSA显著优于四种竞争性基线。困惑度分析和人工检查进一步表明,PCSA 生成更自然和更真实的对话。我们的结果揭示,当前LLM仍然容易受到领域特定对抗策略的攻击,包括提供未经授权的医疗建议、强化妄想以及隐含地鼓励危险行为。

关键词

引用

@article{arxiv.2604.04842,
  title  = {Do No Harm: Exposing Hidden Vulnerabilities of LLMs via Persona-based Client Simulation Attack in Psychological Counseling},
  author = {Qingyang Xu and Yaling Shen and Stephanie Fong and Zimu Wang and Yiwen Jiang and Xiangyu Zhao and Jiahe Liu and Zhongxing Xu and Vincent Lee and Zongyuan Ge},
  journal= {arXiv preprint arXiv:2604.04842},
  year   = {2026}
}