中文

Akasha 2:哈密顿状态空间对偶与视觉语言联合嵌入预测架构

计算机视觉与模式识别 2026-01-13 v1 人工智能

摘要

我们提出 Akasha 2,这是一个 Integrates 哈密顿状态空间对偶(H-SSD)与视觉语言联合嵌入预测架构(VL-JEPA)的前沿多模态架构。该系统利用增强了稀疏哈密顿专家混合(SMoE-HE)的 Mamba-3 选择性状态空间模型(SSM),通过符号积分实现潜在物理守恒律。对于视觉合成,我们引入了哈密顿流匹配(HFM)和持久 3D 高斯溅写(3DGS),实现移动硬件上低于 50ms 的超低延迟。这一工作在潜在世界模型范式中取得突破,通过全息记忆架构实现前所未有的时空一致性。我们的ethods 证明,将物理感知的归纳偏置引入神经网络架构可显著提升性能:领先的视频预测(FVD: 287)、比扩散模型快 4 倍的视觉合成、在保持能量守恒的同时比变压器基线快 3-18 倍。

关键词

引用

@article{arxiv.2601.06212,
  title  = {Akasha 2: Hamiltonian State Space Duality and Visual-Language Joint Embedding Predictive Architectur},
  author = {Yani Meziani},
  journal= {arXiv preprint arXiv:2601.06212},
  year   = {2026}
}

备注

12 pages, 6 figures, 3 tables. Includes appendices with pseudocode and implementation details. Supplementary materials eventually at github.com/yanimeziani/akasha