随机浮点抽样位置编码提升 Transformer 的长度泛化能力
机器学习
2026-02-17 v1
摘要
长度泛化是语言模型在预训练或微调后未见长度上的输入上保持性能的能力。在本工作中,我们引入一种简单而强大的位置编码策略,即随机浮点抽样 (Random Float Sampling, RFS),其在未见长度上具有良好的泛化能力。特别是,RFS 使用随机抽样的连续值,而非从预定义的离散集合中选择位置索引,从而通过在训练期间向模型暴露于多样化的索引来避免未见长度上的分布问题。由于将索引分配给标记是广泛使用的各种位置编码中的常见且基本的程序,RFS 的优势可以轻易地集成到绝对正弦编码、RoPE 和 ALiBi 等位置编码中。实验证明其有效性,通过在长度泛化任务和零样本常识推理基准测试中显示出优异的性能。
引用
@article{arxiv.2602.14050,
title = {Position Encoding with Random Float Sampling Enhances Length Generalization of Transformers},
author = {Atsushi Shimizu and Shohei Taniguchi and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2602.14050},
year = {2026}
}
备注
To appear at EACL 2026