Artificial Intelligence · Computer Science
Mapping AI Benchmark Data to Quantitative Risk Estimates Through Expert Elicitation
Malcolm Murray, Henry Papadatos, Otter Quarks, Pierre-François Gimenez +1
2025-03-11
Computation and Language · Computer Science
LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs
Yujun Zhou, Jingdong Yang, Yue Huang, Kehan Guo +11
2026-02-13
Computation and Language · Computer Science
WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language Models
Prannaya Gupta, Le Qi Yau, Hao Han Low, I-Shiang Lee +7
2024-08-21
Artificial Intelligence · Computer Science
OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety
Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou, Zora Zhiruo Wang +3
2026-02-18
Computation and Language · Computer Science
SafeMT: Multi-turn Safety for Multimodal Language Models
Han Zhu, Juntao Dai, Jiaming Ji, Haoran Li +7
2025-10-15
Computation and Language · Computer Science
SafeLawBench: Towards Safe Alignment of Large Language Models
Chuxue Cao, Han Zhu, Jiaming Ji, Qichao Sun +6
2025-06-10
Computers and Society · Computer Science
Toward Quantitative Modeling of Cybersecurity Risks Due to AI Misuse
Steve Barrett, Malcolm Murray, Otter Quarks, Matthew Smith +16
2025-12-12
Machine Learning · Computer Science
SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond
Xiangyang Zhu, Yuan Tian, Qi Jia, Kaiwei Zhang +13
2026-04-06
Machine Learning · Computer Science
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
Fengqing Jiang, Fengbo Ma, Zhangchen Xu, Yuetai Li +7
2026-04-07
Software Engineering · Computer Science
A.S.E: A Repository-Level Benchmark for Evaluating Security in AI-Generated Code
Keke Lian, Bin Wang, Lei Zhang, Libo Chen +18
2025-09-19
Computation and Language · Computer Science
Machine Translation Meta Evaluation through Translation Accuracy Challenge Sets
Nikita Moghe, Arnisa Fazla, Chantal Amrhein, Tom Kocmi +4
2024-01-30
Cryptography and Security · Computer Science
Amulet: a Python Library for Assessing Interactions Among ML Defenses and Risks
Asim Waheed, Vasisht Duddu, Rui Zhang, Sebastian Szyller
2025-11-10
Computation and Language · Computer Science
CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models
Rui Jia, Ruiyi Lan, Fengrui Liu, Zhongxiang Dai +6
2026-02-06
Cryptography and Security · Computer Science
OCCULT: Evaluating Large Language Models for Offensive Cyber Operation Capabilities
Michael Kouremetis, Marissa Dotter, Alex Byrne, Dan Martin +4
2025-02-25
Computers and Society · Computer Science
AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons
Shaona Ghosh, Heather Frase, Adina Williams, Sarah Luger +98
2025-04-22
Machine Learning · Computer Science
AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts
Shaona Ghosh, Prasoon Varshney, Erick Galinkin, Christopher Parisien
2024-09-12
Computation and Language · Computer Science
MedRiskEval: Medical Risk Evaluation Benchmark of Language Models, On the Importance of User Perspectives in Healthcare Settings
Jean-Philippe Corbeil, Minseon Kim, Maxime Griot, Sheela Agarwal +3
2026-01-12
Computation and Language · Computer Science
LiveSecBench: A Dynamic and Event-Driven Safety Benchmark for Chinese Language Model Applications
Yudong Li, Peiru Yang, Feng Huang, Zhongliang Yang +17
2025-12-23
Artificial Intelligence · Computer Science
SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator
Xueyang Zhou, Weidong Wang, Lin Lu, Jiawen Shi +6
2025-07-21
Cryptography and Security · Computer Science
ACSE-Eval: Can LLMs threat model real-world cloud infrastructure?
Sarthak Munshi, Swapnil Pathak, Sonam Ghatode, Thenuga Priyadarshini +2
2025-05-27
Computation and Language · Computer Science
SafetyAnalyst: Interpretable, Transparent, and Steerable Safety Moderation for AI Behavior
Jing-Jing Li, Valentina Pyatkin, Max Kleiman-Weiner, Liwei Jiang +6
2025-05-29