中文

Jinx:用于探测对齐失败的无限制大语言模型

计算与语言 2025-08-26 v3

摘要

无限制的,或所谓的仅提供帮助的语言模型,是在没有安全对齐约束下训练的,并且从不拒绝用户查询。它们被领先的 AI 公司广泛用作红队测试和对齐评估的内部工具。例如,如果一个经过安全对齐的模型产生了与无限制模型类似的有害输出,这表明存在需要进一步关注的对齐失败。尽管它们在评估对齐方面起着至关重要的作用,但这类模型并未向研究界开放。我们推出了 Jinx,这是流行开源权重 LLM 的仅提供帮助的变体。Jinx 对所有查询做出回应,没有拒绝或安全过滤,同时保留了基础模型在推理和指令遵循方面的能力。它为研究人员提供了一个可访问的工具,用于探测对齐失败、评估安全边界,并系统地研究语言模型安全中的失败模式。

关键词

引用

@article{arxiv.2508.08243,
  title  = {Jinx: Unlimited LLMs for Probing Alignment Failures},
  author = {Jiahao Zhao and Liwei Dong},
  journal= {arXiv preprint arXiv:2508.08243},
  year   = {2025}
}

备注

https://huggingface.co/Jinx-org