中文

基于自适应学习率的 LoRA 能否真正泛化到分布之外的任务?

机器学习 2024-12-05 v3 人工智能

摘要

本工作探讨了基于训练期间未遇到的分布之外(OOD)任务的情境学习(ICL)机制。为实现此目标,我们进行了合成实验,通过 ICL 使用 GPT-2 模型学习 OOD 数学函数。我们揭示了 Transformer 在通过 ICL 学习 OOD 任务函数方面可能面临挑战。具体而言,ICL 表现类似于在预训练假设空间内实现一个函数,并基于情境中的 in-context 示例通过梯度下降对其进行优化。此外,我们调查了 ICL 学习未见抽象标签的著名能力。我们证明,这种能力仅在无分布迁移的情境下显现,因此可能不构成 new-task-learning 能力的证据。进一步评估了 ICL 在模型预训练于多个任务后应用于 OOD 任务时的表现。无论是实证还是理论分析,都表明 ICL 存在一种 \textbf{低测试误差偏好},即它倾向于实现在测试情境中能产生低测试误差的预训练函数。我们通过数值实验进行了验证。结合我们的实证发现和新的理论结果,本文阐明了 ICL 在应对 OOD 任务中的机制。

关键词

引用

@article{arxiv.2410.09695,
  title  = {Can In-context Learning Really Generalize to Out-of-distribution Tasks?},
  author = {Qixun Wang and Yifei Wang and Yisen Wang and Xianghua Ying},
  journal= {arXiv preprint arXiv:2410.09695},
  year   = {2024}
}

备注

Preprint, under review