数据规模成本是否值得?小型注意力仅解码器中的数据集比例定律
机器学习
2026-04-13 v1 计算与语言
摘要
训练 Transformer 语言模型成本高昂,因其性能通常随数据集大小和计算预算的增加而提升。虽然比例定律描述了这种趋势,但在受控、较小规模的设置中,其含义仍较不被探索。在本工作中,我们使用强烈缩减的注意力仅解码器架构来隔离数据集大小效应。通过在 progressively更大的二次幂子集上训练,我们观察到平滑的性能提升伴随明确的边际递减效应,与比例定律行为一致。仅使用约 30% 的训练数据即可达到约 90% 的完整数据验证标记级准确率。这些结果为受控、组件隔离的设置中的数据集规模提供了可操作的见解,并为在计算和数据受限环境中(如小型研究实验室和探索性模型开发)平衡数据集大小与计算成本提供了实用指导。
关键词
引用
@article{arxiv.2604.09389,
title = {Is More Data Worth the Cost? Dataset Scaling Laws in a Tiny Attention-Only Decoder},
author = {Götz-Henrik Wiegand and Lorena Raichle and Rico Städeli and Tomas Hrycej and Bernhard Bermeitinger and Siegfried Handschuh},
journal= {arXiv preprint arXiv:2604.09389},
year = {2026}
}
备注
Presented as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil. Published at 13th IEEE Swiss Conference on Data Science and AI (SDS 2026)