Computation and Language · Computer Science
AnswerCarefully: A Dataset for Improving the Safety of Japanese LLM Output
Hisami Suzuki, Satoru Katsumata, Takashi Kodama, Tetsuro Takahashi +2
2025-06-04
Computation and Language · Computer Science
Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs
Yuxia Wang, Haonan Li, Xudong Han, Preslav Nakov +1
2023-09-06
Computation and Language · Computer Science
SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety
Paul Röttger, Fabio Pernisi, Bertie Vidgen, Dirk Hovy
2025-01-13
Computation and Language · Computer Science
Arabic Dataset for LLM Safeguard Evaluation
Yasser Ashraf, Yuxia Wang, Bin Gu, Preslav Nakov +1
2025-02-11
Computation and Language · Computer Science
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
Yuxia Wang, Zenan Zhai, Haonan Li, Xudong Han +5
2024-08-06
Software Engineering · Computer Science
Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety
Seongmin Lee, Aeree Cho, Grace C. Kim, ShengYun Peng +2
2025-06-09
Machine Learning · Computer Science
Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
Chentao Cao, Xiaojun Xu, Bo Han, Hang Li
2026-03-09
Computation and Language · Computer Science
Cross-Task Defense: Instruction-Tuning LLMs for Content Safety
Yu Fu, Wen Xiao, Jia Chen, Jiachen Li +3
2024-05-27
Computation and Language · Computer Science
Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey
Zhichen Dong, Zhanhui Zhou, Chao Yang, Jing Shao +1
2024-03-28
Computation and Language · Computer Science
DELPHI: Data for Evaluating LLMs' Performance in Handling Controversial Issues
David Q. Sun, Artem Abzaliev, Hadas Kotek, Zidi Xiu +2
2023-11-09
Computation and Language · Computer Science
The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs
Songyang Liu, Chaozhuo Li, Jiameng Qiu, Xi Zhang +4
2025-10-31
Cryptography and Security · Computer Science
Confusion is the Final Barrier: Rethinking Jailbreak Evaluation and Investigating the Real Misuse Threat of LLMs
Yu Yan, Sheng Sun, Zhe Wang, Yijun Lin +5
2025-09-16
Computation and Language · Computer Science
Rethinking How to Evaluate Language Model Jailbreak
Hongyu Cai, Arjun Arunasalam, Leo Y. Lin, Antonio Bianchi +1
2024-05-08
Computation and Language · Computer Science
FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning
Zhehao Zhang, Weijie Xu, Fanyou Wu, Chandan K. Reddy
2025-07-16
Computation and Language · Computer Science
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
Kexin Chen, Yi Liu, Dongxia Wang, Jiaying Chen +1
2024-08-20
Computation and Language · Computer Science
OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance Dataset
Wenbin Hu, Huihao Jing, Haochen Shi, Changxuan Fan +2
2026-04-17
Computation and Language · Computer Science
LegalLens: Leveraging LLMs for Legal Violation Identification in Unstructured Text
Dor Bernsohn, Gil Semo, Yaron Vazana, Gila Hayat +4
2024-02-08
Cryptography and Security · Computer Science
SECURE: Benchmarking Large Language Models for Cybersecurity
Dipkamal Bhusal, Md Tanvirul Alam, Le Nguyen, Ashim Mahara +6
2024-10-31
Computation and Language · Computer Science
Beyond the Safety Bundle: Auditing the Helpful and Harmless Dataset
Khaoula Chehbouni, Jonathan Colaço Carr, Yash More, Jackie CK Cheung +1
2025-06-05