中文

面向多模态大语言模型的关系感知安全消学习

人工智能 2026-03-26 v3

摘要

生成式多模态模型可能存在固有的关系性安全失效:两个良性概念通过特定动作或关系链接后可能变得不安全(例如,孩子与饮酒)。现有的消学习和概念擦除方法通常针对孤立的概念或图像-文本对,可能对同一物体和关系的良性用途造成牺牲。我们提出关系感知安全消学习:一种显式表示不安全对象-关系-对象(O-R-O)元组并应用面向参数高效编辑(LoRA)的框架,以抑制不安全元组同时保留对象边缘分布和安全相邻关系。我们包括基于CLIP的实验以及在仿造、上下文和分布外图像攻击下的鲁棒性评估。

关键词

引用

@article{arxiv.2603.14185,
  title  = {Relationship-Aware Safety Unlearning for Multimodal LLMs},
  author = {Vishnu Narayanan Anilkumar and Abhijith Sreesylesh Babu and Trieu Hai Vo and Mohankrishna Kolla and Alexander Cuneo},
  journal= {arXiv preprint arXiv:2603.14185},
  year   = {2026}
}

备注

9 pages,4figures