Machine Learning · Computer Science
Evaluating Language Model Reasoning about Confidential Information
Dylan Sam, Alexander Robey, Andy Zou, Matt Fredrikson +1
2025-08-28
Cryptography and Security · Computer Science
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
Patrick Chao, Edoardo Debenedetti, Alexander Robey, Maksym Andriushchenko +8
2024-11-04
Artificial Intelligence · Computer Science
Are Bias Evaluation Methods Biased ?
Lina Berrayana, Sean Rooney, Luis Garcés-Erice, Ioana Giurgiu
2025-06-23
Computation and Language · Computer Science
Pitfalls of Evaluating Language Models with Open Benchmarks
Md. Najib Hasan, Md Mahadi Hassan Sibat, Mohammad Fakhruddin Babar, Souvika Sarkar +2
2026-01-08
Machine Learning · Computer Science
A Watermark for Large Language Models
John Kirchenbauer, Jonas Geiping, Yuxin Wen, Jonathan Katz +2
2024-05-03
Cryptography and Security · Computer Science
TRUCE: Private Benchmarking to Prevent Contamination and Improve Comparative Evaluation of LLMs
Tanmay Rajore, Nishanth Chandran, Sunayana Sitaram, Divya Gupta +3
2024-06-25
Machine Learning · Computer Science
Towards Benchmarking Privacy Vulnerabilities in Selective Forgetting with Large Language Models
Wei Qian, Chenxu Zhao, Yangyi Li, Mengdi Huai
2025-12-23
Artificial Intelligence · Computer Science
More than Marketing? On the Information Value of AI Benchmarks for Practitioners
Amelia Hardy, Anka Reuel, Kiana Jafari Meimandi, Lisa Soder +5
2024-12-10
Software Engineering · Computer Science
OpenPerf: A Benchmarking Framework for the Sustainable Development of the Open-Source Ecosystem
Fenglin Bi, Fanyu Han, Shengyu Zhao, Jinlu Li +2
2023-11-28
Computation and Language · Computer Science
A Transparent Fairness Evaluation Protocol for Open-Source Language Model Benchmarking on the Blockchain
Hugo Massaroli, Leonardo Iara, Emmanuel Iarussi, Viviana Siless
2025-08-15
Artificial Intelligence · Computer Science
BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices
Anka Reuel, Amelia Hardy, Chandler Smith, Max Lamparth +2
2024-11-21
Cryptography and Security · Computer Science
CyberMaskQA: A Privacy-Aware Benchmark for Evaluating Large Language Models in Cybersecurity Question Answering
Matilda Gaddi, Jin Noh, Onat Gungor, Tajana Rosing
2026-05-26
Computation and Language · Computer Science
UQ: Assessing Language Models on Unsolved Questions
Fan Nie, Ken Ziyu Liu, Zihao Wang, Rui Sun +10
2025-08-26
Artificial Intelligence · Computer Science
Can We Trust AI Benchmarks? An Interdisciplinary Review of Current Issues in AI Evaluation
Maria Eriksson, Erasmo Purificato, Arman Noroozian, Joao Vinagre +3
2025-05-27
Software Engineering · Computer Science
Towards a Framework for Openness in Foundation Models: Proceedings from the Columbia Convening on Openness in Artificial Intelligence
Adrien Basdevant, Camille François, Victor Storchan, Kevin Bankston +12
2024-05-28
General Economics · Economics
On Benchmark Hacking in ML Contests: Modeling, Insights and Design
Xiaoyun Qiu, Yang Yu, Haifeng Xu
2026-04-27
Computation and Language · Computer Science
BenchBrowser: Retrieving Evidence for Evaluating Benchmark Validity
Harshita Diddee, Gregory Yauney, Swabha Swayamdipta, Daphne Ippolito
2026-04-10
Cryptography and Security · Computer Science
CryptoFormalEval: Integrating LLMs and Formal Verification for Automated Cryptographic Protocol Vulnerability Detection
Cristian Curaba, Denis D'Ambrosi, Alessandro Minisini, Natalia Pérez-Campanero Antolín
2024-11-22
Artificial Intelligence · Computer Science
Aligning Language Model Benchmarks with Pairwise Preferences
Marco Gutierrez, Xinyi Leng, Hannah Cyberey, Jonathan Richard Schwarz +2
2026-05-28
Computers and Society · Computer Science
How Should AI Safety Benchmarks Benchmark Safety?
Cheng Yu, Severin Engelmann, Ruoxuan Cao, Dalia Ali +1
2026-02-10
Computers and Society · Computer Science
Deprecating Benchmarks: Criteria and Framework
Ayrton San Joaquin, Rokas Gipiškis, Leon Staufer, Ariel Gil
2025-07-10