分子与语言的交汇:Transformer-VAE 潜空间中的混淆感知表示学习与化学性质引导
机器学习
2026-05-08 v1
摘要
分子生成模型通常假设存在有意义的潜空间几何结构,但表观的性质可预测性可能反映的是序列层面的捷径,而非化学组织结构。我们在基于 SELFIES 训练的无监督自回归 Transformer-VAE 中研究了这一问题。训练完成后,我们冻结模型,对 RDKit 描述符拟合线性探针,并将探针权重作为候选的全局引导方向。为了将化学信号与 SELFIES 伪影分离,我们引入了一种基于残差化、混淆方向对齐分析和解码分子遍历的混淆感知评估方法。这是必要的,因为 SELFIES 长度、分支 token、环 token 和 token 熵被强烈编码在潜空间中。在此混淆感知评估下,我们发现了针对 cLogP、FractionCSP3、HeavyAtomCount、TPSA、BertzCT 和 HBA 的稳健单调引导。非线性探针进一步表明,某些性质允许稳定的全局方向,而另一些性质则更适合用局部潜梯度来描述。总体而言,我们的结果表明,化学上有意义的引导可以在纠缠的分子潜空间中涌现,但前提是必须通过解码分子进行验证并控制表示层面的混淆。
引用
@article{arxiv.2605.06303,
title = {Molecules Meet Language: Confound-Aware Representation Learning and Chemical Property Steering in Transformer-VAE Latent Spaces},
author = {Zakaria Elabid and Jan Andrzejewski and Bartosz Brzoza and Attila Cangi},
journal= {arXiv preprint arXiv:2605.06303},
year = {2026}
}