HarmTransform:通过多智能体辩论将显式有害查询转化为隐蔽形式
计算与语言
2026-01-01 v1 人工智能
摘要
大型语言模型(LLM)配备了安全机制来检测和阻止有害查询,然而当前的对齐方法主要关注显式危险内容,而忽略了更微妙的威胁。然而,用户通常可以通过隐蔽的改写来伪装有害意图,在保持恶意目标的同时显得无害,这在现有的安全训练数据中造成了显著的缺口。为了解决这一局限性,我们引入了 HarmTransform,一个多智能体辩论框架,用于系统地将有害查询转化为更隐蔽的形式,同时保留其潜在的有害意图。我们的框架利用多个智能体之间的迭代批评和改进,生成高质量、隐蔽的有害查询转换,可用于改进未来的 LLM 安全对齐。实验表明,HarmTransform 在产生有效的查询转换方面显著优于标准基线。同时,我们的分析揭示辩论是一把双刃剑:虽然它可以锐化转换并提高隐蔽性,但也可能引入主题转移和不必要的复杂性。这些见解突显了多智能体辩论在生成全面安全训练数据方面的前景与局限性。
引用
@article{arxiv.2512.23717,
title = {HarmTransform: Transforming Explicit Harmful Queries into Stealthy via Multi-Agent Debate},
author = {Shenzhe Zhu},
journal= {arXiv preprint arXiv:2512.23717},
year = {2026}
}