中文

规模的好坏:如何通过模型大小影响语境诱导的差异性

计算与语言 2026-04-16 v1 机器学习

摘要

更大的语言模型在处理语境信息时变得更好更差——更擅长忽略错误主张,却更差于忽略无关标记。我们通过首个语境诱导比例定律 formalize 这种看似矛盾的现象。分析Cerebras-GPT(111M-13B)和Pythia(410M-12B)模型族,发现语境诱导遵循可预测的幂律规模,但根据语境类型呈现相反趋势:语义语境随规模增大而减弱,而非语义语境随规模增大而增强。具体而言,最大模型比最小模型抗误信息误导能力强4倍,却同时陷入机械复制任意标记的倾向增强2倍。这些 diverging 趋势跨模型族复制,表明语义过滤与机械复制是功能上distinct的行为,规模alone无法解决语境敏感性问题,只能重塑其本质。

关键词

引用

@article{arxiv.2604.13275,
  title  = {Better and Worse with Scale: How Contextual Entrainment Diverges with Model Size},
  author = {Dikshant Kukreja and Kshitij Sah and Gautam Gupta and Avinash Anand and Rajiv Ratn Shah and Zhengkui Wang and Aik Beng Ng and Erik Cambria},
  journal= {arXiv preprint arXiv:2604.13275},
  year   = {2026}
}

备注

16 pages, 11 figures, 6 tables. Accepted to Findings of ACL 2026