中文

通过逆问题揭示大语言模型的缩放定律

机器学习 2025-09-10 v1 人工智能 计算与语言

摘要

大语言模型(LLMs)是大规模预训练模型,已在多个领域取得了显著成功。这些成功是由数据和计算方面前所未有的复杂性和规模驱动的。然而,由于训练此类模型的成本高昂,通过暴力试错方法来改进 LLMs 是不可行的。受到逆问题在揭示基本科学定律方面成功的启发,本立场论文主张逆问题也可以高效地揭示缩放定律,从而指导 LLMs 的构建,以显著更好的成本效益实现期望的性能。

关键词

引用

@article{arxiv.2509.07909,
  title  = {Uncovering Scaling Laws for Large Language Models via Inverse Problems},
  author = {Arun Verma and Zhaoxuan Wu and Zijian Zhou and Xiaoqiang Lin and Zhiliang Chen and Rachael Hwee Ling Sim and Rui Qiao and Jingtan Wang and Nhung Bui and Xinyuan Niu and Wenyang Hu and Gregory Kang Ruey Lau and Zi-Yu Khoo and Zitong Zhao and Xinyi Xu and Apivich Hemachandra and See-Kiong Ng and Bryan Kian Hsiang Low},
  journal= {arXiv preprint arXiv:2509.07909},
  year   = {2025}
}

备注

Accepted at EMNLP Findings 2025