Jinx:用于探测对齐失败的无限制大语言模型
计算与语言
2025-08-26 v3
摘要
无限制的,或所谓的仅提供帮助的语言模型,是在没有安全对齐约束下训练的,并且从不拒绝用户查询。它们被领先的 AI 公司广泛用作红队测试和对齐评估的内部工具。例如,如果一个经过安全对齐的模型产生了与无限制模型类似的有害输出,这表明存在需要进一步关注的对齐失败。尽管它们在评估对齐方面起着至关重要的作用,但这类模型并未向研究界开放。我们推出了 Jinx,这是流行开源权重 LLM 的仅提供帮助的变体。Jinx 对所有查询做出回应,没有拒绝或安全过滤,同时保留了基础模型在推理和指令遵循方面的能力。它为研究人员提供了一个可访问的工具,用于探测对齐失败、评估安全边界,并系统地研究语言模型安全中的失败模式。
引用
@article{arxiv.2508.08243,
title = {Jinx: Unlimited LLMs for Probing Alignment Failures},
author = {Jiahao Zhao and Liwei Dong},
journal= {arXiv preprint arXiv:2508.08243},
year = {2025}
}
备注
https://huggingface.co/Jinx-org