Phaedra:面向物理科学的高保真离散分词
计算机视觉与模式识别
2026-02-05 v1 人工智能
计算工程、金融与科学
机器学习
摘要
离散标记(tokens)是将高维数据转化为可高效学习、生成和泛化到新任务的序列,从而使现代深度学习能够规模化。它们已成为图像和视频生成的基础,近期亦被用于物理仿真。现有标记器是为满足真实视觉感知的明确要求而设计,是否最优用于科学图像——这些图像具有较大的动态范围,需要标记嵌入保留物理和光谱特性——仍值得探讨。本文调查了一系列图像标记器在物理空间和光谱空间中衡量 PDE 属性保真性的指标。基于这些指标难以捕获细节与精确幅值的观察,我们提出 Phaedra,灵感来自经典形状增益量化和正交分解。我们展示了 Phaedra 在各种 PDE 数据集上 consistently improve reconstruction。此外,我们的结果显示其对三个难度递增的任务具有强大的样外分布泛化能力,分别是已知不同条件下的 PDE、未知 PDE 以及真实世界的地球观测和天气数据。
引用
@article{arxiv.2602.03915,
title = {Phaedra: Learning High-Fidelity Discrete Tokenization for the Physical Science},
author = {Levi Lingsch and Georgios Kissas and Johannes Jakubik and Siddhartha Mishra},
journal= {arXiv preprint arXiv:2602.03915},
year = {2026}
}
备注
57 pages, 27 figures