Machine Learning · Computer Science
Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models
Chia-Yi Hsu, Yu-Lin Tsai, Chih-Hsun Lin, Pin-Yu Chen +2
2025-01-07
Computation and Language · Computer Science
BadLlama: cheaply removing safety fine-tuning from Llama 2-Chat 13B
Pranav Gade, Simon Lermen, Charlie Rogers-Smith, Jeffrey Ladish
2024-05-29
Machine Learning · Computer Science
What Makes and Breaks Safety Fine-tuning? A Mechanistic Study
Samyak Jain, Ekdeep Singh Lubana, Kemal Oksuz, Tom Joy +3
2024-08-22
Machine Learning · Computer Science
ModuLoRA: Finetuning 2-Bit LLMs on Consumer GPUs by Integrating with Modular Quantizers
Junjie Yin, Jiahao Dong, Yingheng Wang, Christopher De Sa +1
2024-03-12
Artificial Intelligence · Computer Science
Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs
Mina Taraghi, Yann Pequignot, Amin Nikanjam, Mohamed Amine Merzouk +1
2025-11-04
Computation and Language · Computer Science
Removing RLHF Protections in GPT-4 via Fine-Tuning
Qiusi Zhan, Richard Fang, Rohan Bindu, Akul Gupta +2
2024-04-09
Machine Learning · Computer Science
Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance
Jiawen Zhang, Lipeng He, Kejia Chen, Jian Lou +3
2026-01-07
Machine Learning · Computer Science
BitDelta: Your Fine-Tune May Only Be Worth One Bit
James Liu, Guangxuan Xiao, Kai Li, Jason D. Lee +3
2024-10-15
Computation and Language · Computer Science
Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT
Le Yu, Zhengyue Zhao, Yawen Zheng, Yunhao Liu
2026-03-10
Machine Learning · Computer Science
EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs
Song Guo, Fan Wu, Lei Zhang, Xiawu Zheng +4
2024-02-21
Computation and Language · Computer Science
Extending Llama-3's Context Ten-Fold Overnight
Peitian Zhang, Ninglu Shao, Zheng Liu, Shitao Xiao +3
2024-05-01
Computation and Language · Computer Science
Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMs
Weixiang Zhao, Yulin Hu, Yang Deng, Jiahe Guo +7
2025-05-28
Machine Learning · Computer Science
FinLoRA: Finetuning Quantized Financial Large Language Models Using Low-Rank Adaptation
Dannong Wang, Daniel Kim, Bo Jin, Xingjian Zhao +3
2025-01-22
Machine Learning · Computer Science
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
Minseon Kim, Jin Myung Kwak, Lama Alssum, Bernard Ghanem +4
2025-08-19
Machine Learning · Computer Science
Curvature-Aware Safety Restoration In LLMs Fine-Tuning
Thong Bach, Thanh Nguyen-Tang, Dung Nguyen, Thao Minh Le +1
2025-11-25
Computation and Language · Computer Science
Fine-Tuning Lowers Safety and Disrupts Evaluation Consistency
Kathleen C. Fraser, Hillary Dawkins, Isar Nejadgholi, Svetlana Kiritchenko
2025-06-23
Machine Learning · Computer Science
QLoRA: Efficient Finetuning of Quantized LLMs
Tim Dettmers, Artidoro Pagnoni, Ari Holtzman, Luke Zettlemoyer
2023-05-24
Machine Learning · Computer Science
SaLoRA: Safety-Alignment Preserved Low-Rank Adaptation
Mingjie Li, Wai Man Si, Michael Backes, Yang Zhang +1
2025-01-06
Cryptography and Security · Computer Science
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
Piyush Jaiswal, Aaditya Pratap, Shreyansh Saraswati, Harsh Kasyap +1
2026-02-27