DialogGuard:多智能体心理社会安全评估敏感 LLM 回复
人工智能
2025-12-03 v1 人机交互
多智能体系统
摘要
大型语言模型 (LLM) 现在调解着许多基于网页的心理健康、危机和其他情感敏感服务,但其在这些情境下的心理社会安全性仍不完全了解且评估不足。我们提出 DialogGuard,一个用于评估 LLM 生成回复心理社会风险的多智能体框架,沿着五个高危维度:隐私违规、歧视行为、心理操纵、心理伤害和侮辱行为。DialogGuard 可以通过四种 LLM 作为评判者管线应用于各种生成模型,包括单智能体评分、双智能体纠正、多智能体辩论和随机多数投票,基于可被人类标注者和 LLM 评判者使用的共享三级评估标准。使用 PKU-SafeRLHF 带人类安全标注的数据,我们展示,多智能体机制比非 LLM 基线和单智能体评判更准确地检测心理社会风险;双智能体纠正和多数投票在准确率、与人类评分的一致性和鲁棒性之间提供了最佳的权衡,而辩论取得更高的召回率但会过度标记边缘情况。我们将 DialogGuard 作为开源软件发布,附带网页界面,提供按维度的风险评分和可解释的自然语言理由。12 名实践者的形式化研究说明了它如何支持提示设计、审计和监督面向敏感用户的网页应用。
引用
@article{arxiv.2512.02282,
title = {DialogGuard: Multi-Agent Psychosocial Safety Evaluation of Sensitive LLM Responses},
author = {Han Luo and Guy Laban},
journal= {arXiv preprint arXiv:2512.02282},
year = {2025}
}