中文

PAIR-SAFE:一种用于运行时审计与优化AI介导心理健康支持的配对智能体方法

人机交互 2026-01-21 v1 人工智能 计算与语言 计算机与社会

摘要

大型语言模型(LLM)越来越多地被用于心理健康支持,然而它们可能产生过于指令性、不一致或临床不匹配的回应,尤其是在敏感或高风险情境中。减轻这些风险的现有方法主要依赖于通过训练或提示进行的隐式对齐,其透明度和运行时问责性有限。我们引入了PAIR-SAFE,一个用于审计和优化AI生成的心理健康支持的配对智能体框架,该框架将一个回应智能体与一个基于临床验证的动机性访谈治疗完整性(MITI-4)框架的监督法官智能体相结合。法官智能体审计每个回应,并提供结构化的ALLOW或REVISE决策,以指导运行时的回应优化。我们使用一个源自人工标注动机性访谈数据的支持寻求者模拟器来模拟咨询互动。我们发现,法官监督的互动在关键的MITI维度上显示出显著改善,包括伙伴关系、寻求协作和整体关系质量。我们的定量发现得到了定性专家评估的支持,后者进一步突显了运行时监督的细微差别。总之,我们的结果表明,这种配对智能体方法可以为AI辅助的对话式心理健康支持提供基于临床的审计和优化。

关键词

引用

@article{arxiv.2601.12754,
  title  = {PAIR-SAFE: A Paired-Agent Approach for Runtime Auditing and Refining AI-Mediated Mental Health Support},
  author = {Jiwon Kim and Violeta J. Rodriguez and Dong Whi Yoo and Eshwar Chandrasekharan and Koustuv Saha},
  journal= {arXiv preprint arXiv:2601.12754},
  year   = {2026}
}