DIESEL——基于消避语义嵌入的动态推理引导技术
计算与语言
2025-03-11 v2 机器学习
摘要
近年来,大型语言模型(LLM)在诸如日常对话等任务中取得了显著成功,推动了诸多领域的重要进展,如虚拟助手。然而,它们常常生成不符合人类价值观(如伦理标准、安全性)的响应,导致潜在的不安全或不当输出。虽然已提出多种技术来解决此问题,但它们往往需要计算昂贵的训练或显著增加推理时间。在本文中,我们提出了 DIESEL,这是一种轻量级推理引导技术,可无缝集成到任何自回归 LLM 中,用于从响应中语义地过滤不需要的概念。DIESEL 可作为独立的安全措施或作为额外的防御层,通过在潜在空间中对已定义的负面概念相似性进行重排序来增强响应安全性。我们的评估表明,DIESEL 在最先进的对话模型上有效,即使在挑战响应安全性的对抗性劫持场景中也能发挥作用。我们还突出了 DIESEL 的泛化能力,展示了其在安全之外的其他用例中可提供通用响应过滤功能。
引用
@article{arxiv.2411.19038,
title = {DIESEL -- Dynamic Inference-Guidance via Evasion of Semantic Embeddings in LLMs},
author = {Ben Ganon and Alon Zolfi and Omer Hofman and Inderjeet Singh and Hisashi Kojima and Yuval Elovici and Asaf Shabtai},
journal= {arXiv preprint arXiv:2411.19038},
year = {2025}
}