Cryptography and Security · Computer Science
Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models
Manish Bhatt, Sahana Chennabasappa, Cyrus Nikolaidis, Shengye Wan +17
2023-12-11
Computation and Language · Computer Science
MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks
Jaime Raldua Veuthey, Zainab Ali Majid, Suhas Hariharan, Jacob Haimes
2025-04-22
Cryptography and Security · Computer Science
CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models
Manish Bhatt, Sahana Chennabasappa, Yue Li, Cyrus Nikolaidis +9
2024-04-23
Cryptography and Security · Computer Science
LLMSecCode: Evaluating Large Language Models for Secure Coding
Anton Rydén, Erik Näslund, Elad Michael Schiller, Magnus Almgren
2024-08-30
Cryptography and Security · Computer Science
CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity
Zhengmin Yu, Jiutian Zeng, Siyi Chen, Wenhan Xu +6
2025-01-20
Cryptography and Security · Computer Science
Evaluating LLM Generated Detection Rules in Cybersecurity
Anna Bertiger, Bobby Filar, Aryan Luthra, Stefano Meschiari +3
2025-09-23
Cryptography and Security · Computer Science
CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models
Shengye Wan, Cyrus Nikolaidis, Daniel Song, David Molnar +9
2024-09-10
Cryptography and Security · Computer Science
SECURE: Benchmarking Large Language Models for Cybersecurity
Dipkamal Bhusal, Md Tanvirul Alam, Le Nguyen, Ashim Mahara +6
2024-10-31
Cryptography and Security · Computer Science
The Digital Cybersecurity Expert: How Far Have We Come?
Dawei Wang, Geng Zhou, Xianglong Li, Yu Bai +4
2025-04-17
Cryptography and Security · Computer Science
CyberSOCEval: Benchmarking LLMs Capabilities for Malware Analysis and Threat Intelligence Reasoning
Lauren Deason, Adam Bali, Ciprian Bejean, Diana Bolocan +19
2025-11-12
Cryptography and Security · Computer Science
Large Language Models in Cybersecurity: State-of-the-Art
Farzad Nourmohammadzadeh Motlagh, Mehrdad Hajizadeh, Mehryar Majd, Pejman Najafi +2
2024-02-05
Cryptography and Security · Computer Science
CyberThreat-Eval: Can Large Language Models Automate Real-World Threat Research?
Xiangsen Chen, Xuan Feng, Shuo Chen, Matthieu Maitre +4
2026-03-11
Cryptography and Security · Computer Science
When LLMs Meet Cybersecurity: A Systematic Literature Review
Jie Zhang, Haoyu Bu, Hui Wen, Yongji Liu +6
2024-12-05
Cryptography and Security · Computer Science
Cybersecurity AI Benchmark (CAIBench): A Meta-Benchmark for Evaluating Cybersecurity AI Agents
María Sanz-Gómez, Víctor Mayoral-Vilches, Francesco Balassone, Luis Javier Navarrete-Lozano +2
2025-10-29
Artificial Intelligence · Computer Science
Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks
Regina Gugg, Selina Niederländer, Andreas Stöckl, Martin Flechl
2026-05-12
Computation and Language · Computer Science
CriticEval: Evaluating Large Language Model as Critic
Tian Lan, Wenwei Zhang, Chen Xu, Heyan Huang +3
2024-10-22
Software Engineering · Computer Science
Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval
Jiexin Wang, Xitong Luo, Liuwen Cao, Hongkui He +4
2024-07-08
Cryptography and Security · Computer Science
CTIBench: A Benchmark for Evaluating LLMs in Cyber Threat Intelligence
Md Tanvirul Alam, Dipkamal Bhusal, Le Nguyen, Nidhi Rastogi
2024-11-12