Computation and Language · Computer Science
ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming
Simone Tedeschi, Felix Friedrich, Patrick Schramowski, Kristian Kersting +3
2024-06-25
Artificial Intelligence · Computer Science
Picky LLMs and Unreliable RMs: An Empirical Study on Safety Alignment after Instruction Tuning
Guanlin Li, Kangjie Chen, Shangwei Guo, Jie Zhang +5
2025-02-04
Computation and Language · Computer Science
Gaining Wisdom from Setbacks: Aligning Large Language Models via Mistake Analysis
Kai Chen, Chunwei Wang, Kuo Yang, Jianhua Han +10
2024-02-20
Computation and Language · Computer Science
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
Yuxia Wang, Zenan Zhai, Haonan Li, Xudong Han +5
2024-08-06
Computation and Language · Computer Science
When the Model Said 'No Comment', We Knew Helpfulness Was Dead, Honesty Was Alive, and Safety Was Terrified
Gautam Siddharth Kashyap, Mark Dras, Usman Naseem
2026-02-10
Computation and Language · Computer Science
Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models
Xianjun Yang, Xiao Wang, Qi Zhang, Linda Petzold +3
2023-10-05
Computation and Language · Computer Science
LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs
Yujun Zhou, Jingdong Yang, Yue Huang, Kehan Guo +11
2026-02-13
Computation and Language · Computer Science
Aligners: Decoupling LLMs and Alignment
Lilian Ngweta, Mayank Agarwal, Subha Maity, Alex Gittens +2
2024-10-07
Machine Learning · Computer Science
LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning
Gabriel J. Perin, Runjin Chen, Xuxi Chen, Nina S. T. Hirata +2
2025-07-29
Cryptography and Security · Computer Science
Alleviating the Fear of Losing Alignment in LLM Fine-tuning
Kang Yang, Guanhong Tao, Xun Chen, Jun Xu
2025-04-15
Machine Learning · Computer Science
On the Safety of Open-Sourced Large Language Models: Does Alignment Really Prevent Them From Being Misused?
Hangfan Zhang, Zhimeng Guo, Huaisheng Zhu, Bochuan Cao +4
2023-10-04
Computation and Language · Computer Science
Fake Alignment: Are LLMs Really Aligned Well?
Yixu Wang, Yan Teng, Kexin Huang, Chengqi Lyu +6
2024-04-02
Artificial Intelligence · Computer Science
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
Tinghao Xie, Xiangyu Qi, Yi Zeng, Yangsibo Huang +12
2025-03-04
Computation and Language · Computer Science
When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints
Yuheng Chen, Zhiyu Wu, Bowen Cheng, Tetsuro Takahashi
2026-04-21
Cryptography and Security · Computer Science
Examining Zero-Shot Vulnerability Repair with Large Language Models
Hammond Pearce, Benjamin Tan, Baleegh Ahmad, Ramesh Karri +1
2022-08-16
Computation and Language · Computer Science
Large Language Model Alignment: A Survey
Tianhao Shen, Renren Jin, Yufei Huang, Chuang Liu +5
2023-09-27
Computation and Language · Computer Science
InferAligner: Inference-Time Alignment for Harmlessness through Cross-Model Guidance
Pengyu Wang, Dong Zhang, Linyang Li, Chenkun Tan +4
2024-01-23
Computation and Language · Computer Science
D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models
Satyapriya Krishna, Andy Zou, Rahul Gupta, Eliot Krzysztof Jones +5
2025-09-23
Cryptography and Security · Computer Science
Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?
Yanbo Wang, Jiyang Guan, Jian Liang, Ran He
2025-04-15
Artificial Intelligence · Computer Science
TroubleLLM: Align to Red Team Expert
Zhuoer Xu, Jianping Zhang, Shiwen Cui, Changhua Meng +1
2024-03-05