真相就在其中:通过层选择性秩约简改进语言模型的推理能力
机器学习
2023-12-22 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
基于Transformer的大语言模型(LLMs)已成为现代机器学习中的固定组成部分。相应地,大量资源被投入到旨在进一步推进这项技术的研究中,通常导致模型规模越来越大,训练数据越来越多。然而,这项工作展示了一个令人惊讶的结果:通过选择性地移除权重矩阵的高阶分量,通常可以显著提高LLMs的性能。这种简单的干预,我们称之为层选择性秩约简(LASER),可以在训练完成后对模型进行,并且不需要额外的参数或数据。我们进行了大量实验,证明了这一发现在语言模型和数据集上的普遍性,并提供了深入分析,揭示了LASER何时有效以及其运作机制。
引用
@article{arxiv.2312.13558,
title = {The Truth is in There: Improving Reasoning in Language Models with Layer-Selective Rank Reduction},
author = {Pratyusha Sharma and Jordan T. Ash and Dipendra Misra},
journal= {arXiv preprint arXiv:2312.13558},
year = {2023}
}