超越语言建模:解锁自然数据集的类注意力学习
机器学习
2025-01-14 v1 人工智能
摘要
大语言模型(LLMs)表现出类注意力学习(ICL),该机制使模型能够仅通过上下文中提供的示例而无需更新模型权重即可完成新任务。尽管ICL在自然语言任务和领域中提供了快速适应能力,但其在文本之外的模态中出现的机制则不那么明显。在本文中,我们系统性地揭示了支撑LLMs实现ICL的关键属性,特别是针对自回归模型和各种模态,通过促进ICL所需机制的学习来实现。我们确定训练数据序列中确切的标记重复作为ICL的重要因素。此类重复进一步提高了ICL性能的稳定性并降低了临时性。此外,我们强调了训练任务难度对ICL出现具有重要意义。最后,通过应用我们对ICL出现新见解,我们成功为各种视觉数据集和更具挑战性的EEG分类任务解锁了ICL能力。
引用
@article{arxiv.2501.06255,
title = {Progressive Supervision via Label Decomposition: An Long-Term and Large-Scale Wireless Traffic Forecasting Method},
author = {Daojun Liang and Haixia Zhang and Dongfeng Yuan},
journal= {arXiv preprint arXiv:2501.06255},
year = {2025}
}
备注
Published at Knowledge-Based Systems. arXiv admin note: substantial text overlap with arXiv:2412.00108