各向同性何时能帮助适配 LLM 的数值域下一词预测?
计算与语言
2025-06-24 v4
摘要
大型语言模型(LLM)在预训练过程中学习的情境嵌入向量在诸多数值域下游任务中(如时间序列预测)效果良好。尽管具有显著优势,但 LLM 在此类领域中的幻觉倾向可能在能源、自然、金融、医疗、零售和交通等应用中造成严重后果。为保证数值域下任务中预测的可靠性和准确性,必须打开 LLM 黑盒子,并通过解释提供性能保证。然而,目前对何时预训练语言模型有助于解决数值下游任务几乎没有理论认识。本文通过基于情境嵌入空间中各向同性概念的新型分析,试图弥合这一鸿沟。具体而言,考虑一个以 softmax 为输出层的 LLM 日志线性模型,其中可以通过 LLM 的自注意力机制中的语言模型头部(即语言模型头)从上下文中预测数值数据。对于该模型,证明了在数值域中实现最先进性能所必需,LLM 嵌入的隐藏表示必须具有一种结构,这种结构 accounts for softmax 函数的平移不变性。通过对预训练模型中自注意力的梯度结构进行形式化,我们展示了情境嵌入空间中 LLM 嵌入的各向同性特性如何保留表示的底层结构,从而解决平移不变性问题并提供性能保证。实验表明,数值数据的不同特征和模型架构对各向同性具有不同的影响,而这种可变性直接影响性能。
关键词
引用
@article{arxiv.2505.17135,
title = {When can isotropy help adapt LLMs' next word prediction to numerical domains?},
author = {Rashed Shelim and Shengzhe Xu and Walid Saad and Naren Ramakrishnan},
journal= {arXiv preprint arXiv:2505.17135},
year = {2025}
}