中文

基于 Transformer 的可证明最优传输:深度与提示工程的本质

机器学习 2025-12-19 v3 最优化与控制 机器学习

摘要

尽管基于 Transformer 的模型在语言处理中在实践中表现出色,但其如何对 token 进行对齐的内部机制仍不明确。本文提供了对 token 对齐在大语言模型中进行的机制化和理论解释。我们首先提出实证证据表明,在机器翻译中,注意力权重在各层之间逐渐对齐翻译后的单词对, closely 近似于单词嵌入之间的最优传输 (Optimal Transport)。在此基础上,我们证明了softmax自注意力层可以模拟对熵正则化最优传输问题对偶问题的梯度下降,为对齐提供了理论基础。我们的分析得到了一种构造性收敛界,表明 Transformer 的深度控制 OT 近似精度。直接的含义是,标准 Transformer 可以在无需参数调整的情况下对长度不同的列表进行排序,最多只能出现随 Transformer 深度趋于消失的误差项。

关键词

引用

@article{arxiv.2410.19931,
  title  = {Provable optimal transport with transformers: The essence of depth and prompt engineering},
  author = {Hadi Daneshmand},
  journal= {arXiv preprint arXiv:2410.19931},
  year   = {2025}
}