中文

面向社会敏感领域基础模型的机器人学启发式护栏

人工智能 2026-05-20 v1 机器人学

摘要

基础模型越来越多地部署在教育、心理健康和护理等社会敏感领域,在这些领域中,失败往往是累积性的且依赖于上下文。现有的护栏方法——从训练时对齐到提示、解码约束和事后审核——主要提供经验性风险降低,而非可强制执行的行为保证,并且大多将安全视为单个输出的属性,而非交互轨迹的属性。我们将护栏重新定义为对交互轨迹进行运行时行为控制的问题,借鉴机器人学引入形式化构造,以在不确定的闭环系统中进行约束强制执行。我们在“有根据的观察者”框架中实例化了这些思想,并将其应用于三个真实世界的部署:闲聊、居家自闭症治疗和学校中的行为降级。在这些环境中,该框架能够进行运行时干预,以减轻向不良交互状态的漂移,同时适应多样化的社会语境。我们讨论了该框架的扩展,并提出了朝向更强保证的研究方向。

关键词

引用

@article{arxiv.2605.19940,
  title  = {Robotics-Inspired Guardrails for Foundation Models in Socially Sensitive Domains},
  author = {Rebecca Ramnauth and Drazen Brscic and Brian Scassellati},
  journal= {arXiv preprint arXiv:2605.19940},
  year   = {2026}
}

备注

Under review at Journal of Artificial Intelligence Research (JAIR)