防范另一个 Tessa:面向健康相关 AI 助手的模块化安全中间件
计算机与社会
2025-09-10 v1 人工智能
摘要
2023 年,美国全国进食障碍协会 (NEDA) 的聊天机器人 Tessa 因向易受伤害的用户提供有害的减肥建议而被停用——这一可避免的失败凸显了医疗保健语境下不安全 AI 的风险。本文以 Tessa 为案例研究,考察了安全工程的缺失,并演示了轻量级、模块化的安全防护措施如何能够预防该事件。我们提出了一种混合安全中间件,将确定性词法门控与内联大语言模型 (LLM) 策略过滤器相结合,在单次模型调用中执行故障关闭判定和升级路径。使用合成评估,我们表明该设计在基线成本和延迟下实现了对不安全提示的完美拦截,优于传统的多阶段流水线。除了技术补救措施外,我们将 Tessa 的失败模式映射到既有框架(OWASP LLM Top10、NIST SP 800-53),将实际防护措施与可操作的治理控制联系起来。结果强调,健康相关 AI 中稳健、可审计的安全并不需要重型基础设施:在最后一公里的明确、可测试的检查足以防止“另一个 Tessa”,而治理和升级确保了真实世界部署中的可持续性。
引用
@article{arxiv.2509.07022,
title = {Preventing Another Tessa: Modular Safety Middleware For Health-Adjacent AI Assistants},
author = {Pavan Reddy and Nithin Reddy},
journal= {arXiv preprint arXiv:2509.07022},
year = {2025}
}
备注
7 pages content, 1 page reference, 1 figure, Accepted at AAAI Fall Symposium Series