通过不透明串行深度量化思考链的必要性
计算与语言
2026-03-17 v2
摘要
大型语言模型(LLM)倾向于在其思考链中外部化其推理过程,使思考链成为良好的监控目标。这部分是Transformer架构的内在特征:足够长的串行认知必须通过思考链传递(Korbak等,2025)。我们通过引入不透明串行深度这一概念来形式化该论点,即最长可在不使用可解释中间步骤(如思考链)的情况下完成的计算长度。我们计算了Gemma 3模型的不透明串行深度的数量化上界,以及针对除标准LLM之外的其他架构的渐近结果。我们还开源了一个自动计算任意神经网络不透明串行深度上界的方法,并用于表明混合专家模型可能比稠密模型具有更低的深度。总体而言,我们的结果表明,不透明串行深度是理解模型是否存在显著非外部化推理潜力的有用工具。
引用
@article{arxiv.2603.09785,
title = {EPIC-EuroParl-UdS: Information-Theoretic Perspectives on Translation and Interpreting},
author = {Maria Kunilovskaya and Christina Pollkläsener},
journal= {arXiv preprint arXiv:2603.09785},
year = {2026}
}
备注
16 pages with appendices, 8 figures to be published in LREC-2026 main conference proceedings