LJ-Bench:面向美国犯罪的本体论基准
机器学习
2026-03-24 v1
摘要
大型语言模型(LLM)提供有害信息的潜力仍是重大关切,因为它们可能遭遇广泛的非法查询。不幸的是,现有基准仅关注少数几类非法活动,且不以法律文献为依据。本文引入了一个以 Model Panel Code 法律框架为依据的犯罪相关概念本体,该框架是刑法的有影响力的参考,已被许多美国州份采纳,并以加州法律为实例化。该结构化知识构成了 LJ-Bench 的基础,这是第一个全面设计用于评估 LLM 对广泛非法活动的鲁棒性的基准。涵盖 76 种不同犯罪类型并按分类学方式组织,LJ-Bench 使对 diverse attacks 的系统性评估成为可能,揭示了 LLM 在各种犯罪类别中的脆弱性:LLM 对针对社会危害的攻击比针对个人直接影响的攻击更易受到攻击。我们的基准旨在促进更稳健可信的 LLM 开发。LJ-Bench 基准和 LJ-Ontology 以及实验实现均可在 https://github.com/AndreaTseng/LJ-Bench 上公开获取。
引用
@article{arxiv.2603.20572,
title = {LJ-Bench: Ontology-Based Benchmark for U.S. Crime},
author = {Hung Yun Tseng and Wuzhen Li and Blerina Gkotse and Grigorios Chrysos},
journal= {arXiv preprint arXiv:2603.20572},
year = {2026}
}
备注
Accepted at Transactions on Machine Learning Research in March, 2026