通过 Ascend NPU 上的高效对比解码提升 LoRA 适配器中学习的知识
机器学习
2025-10-03 v1 计算与语言
摘要
华为云用户广泛采用 LoRA(Low-Rank Adaptation)作为高效可扩展的方法,对大型语言模型(LLM)进行针对性微调和定制。然而,对于需要复杂推理或深层语境理解的任务,常用解码方法(如贪婪搜索或束搜索)会受基模型偏置或干扰的限制,导致输出泛化或与任务无关。本文提出对比 LoRA 解码(Contrastive LoRA Decoding, CoLD),一种新型解码框架,通过对比 LoRA 微调专家模型与基模型的概率分布差异,对候选 token 进行评分,从而优先选择更符合 LoRA 学习表示的 token,显著提升下游任务性能。为解决 CoLD 实现的计算开销问题,本文开发了针对华为 Ascend NPU 的优化内核。实验表明,CoLD 在任务准确率上提升最高可达 5.54%,而端到端延迟降低 28%。本工作为资源受限环境下的微调 LLM 提供了实用且高效的解码策略,对云端及本地部署的应用数据科学具有广泛意义。
关键词
引用
@article{arxiv.2505.14620,
title = {Enhancing Learned Knowledge in LoRA Adapters Through Efficient Contrastive Decoding on Ascend NPUs},
author = {Morgan Lindsay Heisler and Linzi Xing and Ge Shi and Hanieh Sadri and Gursimran Singh and Weiwei Zhang and Tao Ye and Ying Xiong and Yong Zhang and Zhenan Fan},
journal= {arXiv preprint arXiv:2505.14620},
year = {2025}
}
备注
Accepted at ACM KDD 2025