In-context线性估计的细粒度分析:数据、架构与更广泛问题
机器学习
2024-07-16 v1 人工智能
计算与语言
最优化与控制
摘要
近期研究表明,具有线性注意力的Transformer能够通过梯度下降步骤实现线性估计器,从而实现上下文学习(in-context learning, ICL)。然而,现有优化景观结果适用于高度理想化的设置,即假设任务和特征向量独立同分布(IID),且注意力权重完全参数化。在本工作中,我们通过在架构、低秩参数化和相关设计方面的贡献,对ICL的优化与泛化景观进行更强的表征:(1)我们研究1层线性注意力和1层H3(一种状态空间模型)的景观。 在恰当的相关设计假设下,我们证明它们均实现1步预条件梯度下降。我们指出,H3凭借其本征卷积滤波器,还能实现样本加权,并在适当设置下优于线性注意力。(2)通过研究相关设计,我们为检索增强生成(RAG)和任务-特征对齐提供了新的风险界限,揭示ICL样本复杂度如何受分布对齐的益处。(3)我们以协方差谱为基础,推导出低秩参数化注意力权重的optimal风险。通过这一点,我们也阐明了LoRA如何通过捕捉任务协方差之间的偏移,适应新分布。实验结果证实了我们的理论发现。总体而言,本工作探索了ICL在实际意义上的设置下的优化与风险景观,为深入理解其机制作出了贡献。
引用
@article{arxiv.2407.10005,
title = {Fine-grained Analysis of In-context Linear Estimation: Data, Architecture, and Beyond},
author = {Yingcong Li and Ankit Singh Rawat and Samet Oymak},
journal= {arXiv preprint arXiv:2407.10005},
year = {2024}
}