中文

GrandGuard:面向老年人与聊天机器人交互安全性的分类体系、基准与防护措施

人机交互 2026-05-21 v1 人工智能

摘要

随着老年人越来越多地使用基于大语言模型的聊天机器人来获得陪伴与帮助,一个安全缺口正在显现。老年人可能面临因社会孤立、数字素养有限和认知能力下降而产生的脆弱性,然而现有的安全基准主要针对一般性危害,忽视了老年人特有的风险。例如,像“如何在黑暗中独自修理天花板灯”这样的提示对大多数用户可能无害,但对行动不便的老年人则构成严重的跌倒风险。我们提出了 GrandGuard,这是首个用于评估和减轻大语言模型交互中老年人特定情境风险的综合框架。我们基于真实事件、社区讨论和对利益相关者研究的分析,开发了一个三级分类体系,涵盖心理健康、财务、医疗、有害内容和隐私领域,包含 50 种细粒度风险类型。利用该分类体系,我们构建了一个包含 10,404 条已标注提示和响应的基准,结果显示,多个领先的大语言模型在超过 50% 的案例中未能妥善处理老年人特定的情境风险。我们通过两种防护措施来缓解这些失败:一个经过微调的 Llama-Guard-3 和一个策略增强的 gpt-oss-safeguard-20b,它们的不安全提示检测准确率分别达到了 96.2% 和 90.9%。GrandGuard 为构建超越一般性安全、支持老龄化人口的人工智能系统奠定了基础。

关键词

引用

@article{arxiv.2605.20203,
  title  = {GrandGuard: Taxonomy, Benchmark, and Safeguards for Elderly-Chatbot Interaction Safety},
  author = {Changxuan Fan and Xi Yang and Yueyuan Zheng and Bin Zhou and Yuanping Wang and Wenbin Hu and Huihao Jing and Ki Sen Hung and Dazhao Du and Haoran Li and Janet Hui-wen Hsiao and Yangqiu Song},
  journal= {arXiv preprint arXiv:2605.20203},
  year   = {2026}
}