RoleBreak:角色扮演系统中的角色幻觉越狱攻击
计算与语言
2024-09-26 v1
摘要
由大语言模型(LLMs)驱动的角色扮演系统在情感交流应用中的影响力日益增加。然而,这些系统容易出现角色幻觉,即模型偏离预定义的角色设定,并生成与预期角色不一致的回复。本文从攻击角度首次对角色幻觉进行了系统分析,提出了 RoleBreak 框架。我们的框架识别出两个核心机制——查询稀疏性和角色-查询冲突——作为驱动角色幻觉的关键因素。利用这些见解,我们构建了一个新颖的数据集 RoleBreakEval,以评估现有的幻觉缓解技术。我们的实验表明,即使是经过训练以最小化幻觉的增强模型,在面对攻击时仍然存在脆弱性。为了解决这些漏洞,我们提出了一种新颖的防御策略——叙述者模式,它通过叙述生成补充上下文,以缓解角色-查询冲突并改善查询泛化。实验结果表明,叙述者模式通过减少幻觉、增强对角色和查询的保真度以及提高整体叙事连贯性,显著优于传统的基于拒绝的策略。
引用
@article{arxiv.2409.16727,
title = {RoleBreak: Character Hallucination as a Jailbreak Attack in Role-Playing Systems},
author = {Yihong Tang and Bo Wang and Xu Wang and Dongming Zhao and Jing Liu and Jijun Zhang and Ruifang He and Yuexian Hou},
journal= {arXiv preprint arXiv:2409.16727},
year = {2024}
}