中文

大型语言模型中的内在张量场传播:一种上下文信息流的新方法

计算与语言 2025-03-26 v2

摘要

上下文传播仍是语言模型体系结构中的核心挑战,尤其是在需要保持长程依赖的任务中。虽然注意力机制在许多应用中有效,但由于依赖离散标记间的交互,注意力机制在维持长序列上的连贯上下文表示方面存在局限。本文引入一种新方法,通过将上下文关系建模为跨标记嵌入分布的连续张量场来实现上下文信息的传播。传播动力学由微分方程控制,实现上下文信息的结构化流动,增强标准注意力机制以提高连贯性和记忆能力。一系列在开源基于变换器的模型上进行的实验表明,ITFP 在上下文保持、依赖解析和推理稳定性方面均可实现可衡量的改进。与基线模型比较显示,ITFP 可减少语法不一致和事实错误,消融研究表明,传播深度和集成强度对模型性能具有显著影响。额外的评估表明,ITFP 在不同文本语料中具有良好的域泛化能力,强化了其在常规语言建模任务之外的适用性。尽管引入张量场计算带来了计算权衡,但实证结果表明,准确度和连贯性的提升已超过处理需求的增加。

关键词

引用

@article{arxiv.2501.18957,
  title  = {Intrinsic Tensor Field Propagation in Large Language Models: A Novel Approach to Contextual Information Flow},
  author = {Alfred Bexley and Lukas Radcliffe and Giles Weatherstone and Joseph Sakau},
  journal= {arXiv preprint arXiv:2501.18957},
  year   = {2025}
}

备注

arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship