ViSymRe: 视觉多模态符号回归
机器学习
2026-01-26 v4 人工智能
符号计算
摘要
从观测数据集中提取可解释方程以描述复杂自然现象,是人工智能的核心目标之一。该领域被称为符号回归(SR)。近年来,基于Transformer的范式已成为SR的新趋势,解决了众所周知的搜索效率低下问题。然而,数据集与方程之间的模态异质性常常阻碍这些模型的收敛和泛化。本文,我们提出ViSymRe,一个视觉符号回归框架,旨在探索视觉模态在增强基于Transformer的SR范式性能中的积极作用。为克服视觉SR模型在高维场景下不可训练的挑战,我们提出了多视角随机切片(MVRS)。通过使用随机仿射变换将多元方程投影到二维空间,MVRS避免了高维可视化中的常见缺陷,如变量退化、非线性交互缺失和指数增长的采样复杂度,使ViSymRe能够以低计算成本进行训练。为支持ViSymRe的数据集独立部署,我们设计了一种基于生成技术的双视觉流水线架构,通过辅助视觉解码器直接从数据集中重建视觉特征,并通过提出的偏置交叉注意力特征融合模块自动抑制重建噪声的注意力权重,确保后续过程不受噪声模态的影响。消融研究表明视觉模态对提高模型收敛水平和增强各种SR指标具有积极作用。此外,在主流基准上的评估结果表明,ViSymRe与基线相比具有竞争力,特别是在低复杂度和快速推理场景中。
引用
@article{arxiv.2412.11139,
title = {ViSymRe: Vision Multimodal Symbolic Regression},
author = {Da Li and Junping Yin and Jin Xu and Xinxin Li and Juan Zhang},
journal= {arXiv preprint arXiv:2412.11139},
year = {2026}
}