面向社会敏感领域基础模型的机器人学启发式护栏
人工智能
2026-05-20 v1 机器人学
摘要
基础模型越来越多地部署在教育、心理健康和护理等社会敏感领域,在这些领域中,失败往往是累积性的且依赖于上下文。现有的护栏方法——从训练时对齐到提示、解码约束和事后审核——主要提供经验性风险降低,而非可强制执行的行为保证,并且大多将安全视为单个输出的属性,而非交互轨迹的属性。我们将护栏重新定义为对交互轨迹进行运行时行为控制的问题,借鉴机器人学引入形式化构造,以在不确定的闭环系统中进行约束强制执行。我们在“有根据的观察者”框架中实例化了这些思想,并将其应用于三个真实世界的部署:闲聊、居家自闭症治疗和学校中的行为降级。在这些环境中,该框架能够进行运行时干预,以减轻向不良交互状态的漂移,同时适应多样化的社会语境。我们讨论了该框架的扩展,并提出了朝向更强保证的研究方向。
引用
@article{arxiv.2605.19940,
title = {Robotics-Inspired Guardrails for Foundation Models in Socially Sensitive Domains},
author = {Rebecca Ramnauth and Drazen Brscic and Brian Scassellati},
journal= {arXiv preprint arXiv:2605.19940},
year = {2026}
}
备注
Under review at Journal of Artificial Intelligence Research (JAIR)