超bolic微调用于大型语言模型
机器学习
2026-02-09 v2 人工智能
计算与语言
神经与进化计算
摘要
大型语言模型(LLMs)在各种任务上已展现出惊人的性能,但是否默认的欧几里得空间是LLMs最合适的选择仍是一个开放问题。本研究聚焦于LLMs的几何特征,具体指标记(tokens)及其嵌入向量。我们的发现表明,标记频率遵循幂律分布,其中高频标记(如the, that)构成少数,而低频标记(如apple, dog)则构成多数。此外,高频标记聚集在原点附近,而低频标记则位于嵌入空间中更远的地方。进一步地,标记嵌入呈现出超bolic特征,表明嵌入空间潜在存在树状结构。基于这些观察,我们提出了HypLoRA,这是一种高效的微调方法, operates in hyperbolic space以更好地利用这些潜在的层次结构。HypLoRA直接在超bolic空间中执行低秩适应,从而在微调过程中保持超bolic建模能力。针对各种基础模型和推理基准(特别是算术和常识推理任务),进行了广泛实验,结果表明HypLoRA显著性地改进了LLM性能。
引用
@article{arxiv.2410.04010,
title = {Hyperbolic Fine-Tuning for Large Language Models},
author = {Menglin Yang and Ram Samarth B B and Aosong Feng and Bo Xiong and Jihong Liu and Irwin King and Rex Ying},
journal= {arXiv preprint arXiv:2410.04010},
year = {2026}
}
备注
NeurIPS 2025; https://github.com/marlin-codes/HypLoRA