大语言模型福祉智能体中的支持性-安全性权衡
人机交互
2026-02-05 v1 机器人学
摘要
大语言模型正被整合到社交辅助机器人和其他提供心理健康与福祉支持的人机对话智能体中。这些智能体通常被设计得听起来富有同理心和支持性,以最大化用户的参与度,然而,系统提示中支持性框架水平的提升如何影响与安全相关的行为仍不清楚。我们在3个具有不同支持性水平的系统提示下,对6个LLM在涵盖4个福祉领域的80个合成查询上进行了评估。一个基于人类评分验证的LLM评判框架评估了安全性和护理质量。中等支持性的提示在保持安全性的同时改善了同理心和建设性支持。相比之下,强烈肯定的提示在所有领域都显著降低了安全性,在某些情况下还降低了护理质量,且不同模型之间存在显著差异。我们讨论了这些发现对SAR部署中提示设计、模型选择和特定领域安全措施的影响。
引用
@article{arxiv.2602.04487,
title = {The Supportiveness-Safety Tradeoff in LLM Well-Being Agents},
author = {Himanshi Lalwani and Hanan Salam},
journal= {arXiv preprint arXiv:2602.04487},
year = {2026}
}