相同图,不同似然:通过排列等价编码校准自回归图生成器
机器学习
2026-04-08 v1
摘要
自回归图生成器通过顺序构建过程定义似然,但这些似然仅在同一图的所有线性化中保持一致时才有意义。分段欧拉邻域轨迹 (SENT) 是一种最近的线性化方法,将图转换为可由语言模型完美解码和高效处理的序列,但允许同一图存在多个等价线性化。我们使用等价线性化之间的变异系数来量化分配的负对数似然 (NLL) 的违反,我们称之为线性化不确定性 (LU)。在四个线性化策略下训练变换器并在两个数据集上,我们表明有偏排序在其原生排序上获得较低的 NLL,但在随机排列下表现出高出两个数量级的期望校准误差 (ECE),表明这些模型学习的是训练线性化而非底层图。在分子图基准 QM9 上,生成图的 NLL 与分子稳定性呈负相关 (AUC = 0.43),而 LU 达到 AUC = 0.85,表明基于排列的评估为生成分子提供了更可靠的质量检查。代码可在 https://github.com/lauritsf/linearization-uncertainty 获取。
引用
@article{arxiv.2604.05613,
title = {Same Graph, Different Likelihoods: Calibration of Autoregressive Graph Generators via Permutation-Equivalent Encodings},
author = {Laurits Fredsgaard and Aaron Thomas and Michael Riis Andersen and Mikkel N. Schmidt and Mahito Sugiyama},
journal= {arXiv preprint arXiv:2604.05613},
year = {2026}
}
备注
Workshop 'Towards Trustworthy Predictions: Theory and Applications of Calibration for Modern AI' at AISTATS 2026, Tangier, Morocco