先做边缘分布再做条件分布
机器学习
2026-03-12 v1 人工智能
摘要
我们构建了一个最小任务,以隔离神经网络中的条件学习:一个满射映射具有 K 倍歧义,通过选择器标记 z 来解决,使得 H(A | B) = log K,而 H(A | B, z) = 0。模型首先学习边缘分布 P(A | B),在恰好 log K 处产生一个平台,然后再获得完整的条件分布,以一个尖锐的、集体性的转变完成。平台有一个干净的分解:高度 = log K(由歧义决定),持续时间 = f(D)(由数据集大小 D 决定,而非 K)。梯度噪声稳定了边缘解:更高的学习率单调地减慢转变速度(在固定吞吞量下跨越 7 倍 范围),批量大小的减少延迟逃逸,符合抗离开边缘解的熵力。内部,一个选择器-路由头在平台期间被组装,领先于损失转变约占等待时间的 50%。这是 Papadopoulos 等人 [2024] 第 2 类方向不对称性的测量:我们动态地跟踪从 log K 到 0 的剩余风险,并描述稳定它的因素、触发它的机制以及它需要多少时间。
引用
@article{arxiv.2603.10074,
title = {Marginals Before Conditionals},
author = {Mihir Sahasrabudhe},
journal= {arXiv preprint arXiv:2603.10074},
year = {2026}
}
备注
13 pages, 5 figures