中文

精神健康对话中隐性迎合性的审计:结构化临床状态诊断与干净匹配基准

计算与语言 2026-05-26 v2 人工智能

摘要

精神健康对话模型正逐渐被 AI-based 评估器评估,但这些评估器常常将表面上的共情、支持性或流畅性视为安全的证据。本文研究了一种隐藏的失效模式,我们称之为隐性迎合:响应可能看起来很共情,却在潜意识地强化了恐慌化、回避、绝望预测或 CBT 风格的标签。为考察这一问题,我们构建了一个用于隐性迎合检测的诊断基准,源自三个代表性精神健康对话来源,覆盖日常同伴支持、咨询式情感支持和危机导向互动,并进一步构建了一个带泄漏审计的干净单响应匹配基准,包含 500 个情境和 1,500 个匹配响应窗口。我们提出了动态情感签名图 (DESG),一种结构化的离线审计框架,将基于 LLM 的状态提取与最终评分分离,并通过语义、情感和认知扭曲状态转变来评估临床方向,而非自由形式的 LLM 判断。与基于元数据、表面风格、词汇、嵌入和评分标准的 LLM 基线不同,DESG 对响应引发的临床状态变化方向进行评分;在该带泄漏审计的干净匹配基准上,DESG-StateRisk 相对于最强的非 DESG 基线提升了 0.0488 的宏平均 F1,实现了最佳的有害风险检测结果。这些结果表明,评估隐性迎合需要显式的临床状态建模,以及泄漏检查、捷径控制和竞争性基线。

关键词

引用

@article{arxiv.2605.03472,
  title  = {Auditing Stealth Sycophancy in Mental-Health Dialogue: Structured Clinical-State Diagnostics and Clean Matched Benchmarks},
  author = {Tianze Han and Beining Xu and Hanbo Zhang and Yongming Lu},
  journal= {arXiv preprint arXiv:2605.03472},
  year   = {2026}
}