中文

LoRA-BAM:通过 LoRA 层上的盒式抽象监控器对微调 LLM 进行输入过滤

机器学习 2025-06-03 v1

摘要

微调大型语言模型(LLM)可提升其在特定领域任务上的性能,但可能导致过拟合,使其在分布外(OoD)查询上变得不可靠。我们提出 LoRA-BAM——一种使用盒式抽象向 LoRA 层添加 OoD 检测监控器的方法,以过滤超出模型能力范围的问题。通过 LLM 从微调数据中提取特征向量并进行聚类。聚类被包围在盒中;如果某问题的特征向量落在所有盒之外,则被标记为 OoD。为提高可解释性和鲁棒性,我们在微调期间引入正则化损失,鼓励释义问题在特征空间中保持接近,并且决策边界的扩大基于聚类内的特征方差。我们的方法通过提供轻量且可解释的 OoD 检测,补充了现有防御方法。

关键词

引用

@article{arxiv.2506.00998,
  title  = {LoRA-BAM: Input Filtering for Fine-tuned LLMs via Boxed Abstraction Monitors over LoRA Layers},
  author = {Changshun Wu and Tianyi Duan and Saddek Bensalem and Chih-Hong Cheng},
  journal= {arXiv preprint arXiv:2506.00998},
  year   = {2025}
}