中文

困境中的选择:伦理推理与LLM安全对齐之间的张力

密码学与安全 2025-09-09 v1 网络与互联网体系结构

摘要

大型语言模型的安全对齐主要基于假设请求要么是安全的,要么是不安全的,这种分类在模型遇到伦理困境时证明不足,因为能够通过道德权衡进行推理的能力会创造出不同的攻击面。我们通过TRIAL(一个多轮红队测试方法)来正式化这一漏洞,该方法将有害请求嵌入伦理框架中。TRIAL通过系统性地利用模型的伦理推理能力,将有害行为包装为道德必要妥协,从而在大多数测试模型中实现高攻击成功率。基于这些见解,我们引入ERR(伦理推理鲁健性),一种防御框架,区分能够导致有害结果的工具性响应与分析伦理框架而不倾向于推广有害行为的解释性响应。ERR采用分层伤害门控LoRA架构,能够在保持模型实用性的同时,对抗基于推理的攻击。

关键词

引用

@article{arxiv.2509.05366,
  title  = {A Framework for Detection and Classification of Attacks on Surveillance Cameras under IoT Networks},
  author = {Umair Amjid and M. Umar Khan and S. A. Manan Kirmani},
  journal= {arXiv preprint arXiv:2509.05366},
  year   = {2025}
}