中文

从语法到语义:揭示 SMILES 翻译模型中手性的涌现

机器学习 2026-05-12 v1

摘要

理解化学语言模型(CLM)如何从分子字符串表示中学习化学含义,而不仅仅是表层字符串模式,是化学表示学习和化学机器学习中的一个重要问题。手性提供了一个严苛的测试案例:对映异构体在药理活性和毒性上可能差异很大,但 CLM 通常难以可靠地区分手性构型。在此,我们提出了 Pan-CORE(Pan-Chemical Omniscale Representation Engine),这是一系列基于自回归 Transformer 的编码器-解码器 SMILES 翻译模型,并使用高时间分辨率检查点分析来研究训练过程中手性信息是如何学习的。在所有测试的 Pan-CORE 变体中,我们观察到一个可复现的突跃,其中手性 token 准确率在经历长时间的停滞平台后突然上升,这表明手性学习停滞不能仅由模型容量来解释,而是反映了手性约束的复杂性。对注意力动态、残差流轨迹和潜空间几何的分析支持了一种以编码器为中心的机制,其中手性 token 表示经历了瞬态失稳和重构,表现为向量范数和方向稳定性的 V 型下降与恢复,同时潜空间中手性分子表示发生了明显的重组。编码器-解码器交叉评估进一步支持了这一转变以编码器为中心的性质,而针对性的注意力头消融识别出一小部分对手性敏感的注意力头,即使是在完全训练的模型中,移除它们也会选择性地降低手性 token 准确率。这些发现表明,SMILES 翻译可以作为分析 CLM 中语义涌现机制的有用实验系统,对可解释的化学表示学习具有启示意义。

关键词

引用

@article{arxiv.2605.09949,
  title  = {From Syntax to Semantics: Unveiling the Emergence of Chirality in SMILES Translation Models},
  author = {Zehao Li and Yasuhiro Yoshikai and Shumpei Nemoto and Hiroyuki Kusuhara and Tadahaya Mizuno},
  journal= {arXiv preprint arXiv:2605.09949},
  year   = {2026}
}