中文

面屈程式语言偏好获取缓慢——以瑞典语为例

计算与语言 2026-02-04 v1

摘要

本研究探讨了语言模型在预训练期间以及在从英语适应瑞典语期间,如何发展对比较习语(idiomatic)与语言上可接受(linguistically acceptable)瑞典语的偏好。为此,我们从头训练瑞典语模型并通过微调英语预训练模型, 在各个检查点上使用最小配对样本进行探测,这些样本在语言可接受性或习语性方面存在差异。对于语言可接受性,我们将现有基准转化为最小配对格式。为评估习语性,我们引入两个新数据集:一个对比常规化习语与合理变体,另一个对比习语瑞典语与翻译稿。我们的发现表明,习语能力的形成比其他语言能力(包括语法和词汇正确性)更慢。虽然较长的训练对大多数任务收益递减,但习语相关的性能持续提升,尤其在最大模型(8B)处表现突出。然而,对来自英语的机器翻译数据进行指令微调——这是语言数据稀缺或缺乏本土指令数据的常用做法——会导致模型迅速丢失对习语语言的偏好。

关键词

引用

@article{arxiv.2602.03484,
  title  = {Preferences for Idiomatic Language are Acquired Slowly -- and Forgotten Quickly: A Case Study on Swedish},
  author = {Jenny Kunz},
  journal= {arXiv preprint arXiv:2602.03484},
  year   = {2026}
}

备注

Accepted to TACL. Note that the arXiv version is a pre-MIT Press publication version