论点:理解大语言模型需要超越统计泛化
机器学习
2024-06-18 v3 机器学习
摘要
过去十年间,深度学习理论研究不断探索以回答"为什么深度学习会泛化?"的最新进展:对过参数化模型在插值范式下的研究。本文认为另一种视角转变也随时而至,因为一些 LLM 令人满意的特性并非源于良好的统计泛化,而需要独立的理论解释。我们的核心论点基于以下观察:AR 概率模型本质上不可识别:彼此零或接近零 KL 散度的模型——因此等价的测试损失——可能呈现出截然不同的行为。我们通过数学示例和经验观察支持了这一观点,阐明了不可识别性在实际中的实际相关性,通过三个案例研究:(1)零样本规则外推的不可识别性;(2)类内学习的近似不可识别性;(3)微调的不可识别性。我们回顾了聚焦于 LLM 相关泛化措施、可迁移性和归纳偏置的有前景的研究方向。
引用
@article{arxiv.2405.01964,
title = {Position: Understanding LLMs Requires More Than Statistical Generalization},
author = {Patrik Reizinger and Szilvia Ujváry and Anna Mészáros and Anna Kerekes and Wieland Brendel and Ferenc Huszár},
journal= {arXiv preprint arXiv:2405.01964},
year = {2024}
}
备注
Accepted as a position paper at ICML2024, Code: https://github.com/rpatrik96/llm-non-identifiability