中文

Sigma:通向视觉-语言-动作模型的 telepathic 对齐之钥

机器学习 2026-01-23 v3 机器人学

摘要

为解决认知系统中缺乏语义与连续控制之间可更新中介思维空间的根本性局限,本 work构建并训练了称为Sigma的视觉-语言-动作模型,部署于单张RTX 4090上。该模型基于开源pi0.5_base backbone构建,將svla_so101_pickplace数据集预处理为结构化训练语料库。引入独立设计的VLA architecture,将深层语义理解与联想推理集成,实现感知与动作之间的 telepathic 对齐。训练通过数据预处理、LoRA-based fine-tuning和推理阶段适配器设计的迭代优化进行。采用离线闭环回放进行评估,将Sigma与未调谐的pi0.5_base在相同数据条件下进行比较。实验结果表明,Sigma在向量、片段和轨迹级别的控制MSE均实现一致降低,同时保持 telepathy norm和语义-文本对齐质量的稳定性。这些发现表明,通过语义和联想架构集成,无需重新训练基础模型,即可实现mind-responsive 对齐控制,为语义对齐和意图驱动行为提供了可复现的路径。

关键词

引用

@article{arxiv.2512.00783,
  title  = {Sigma: The Key for Vision-Language-Action Models toward Telepathic Alignment},
  author = {Libo Wang},
  journal= {arXiv preprint arXiv:2512.00783},
  year   = {2026}
}

备注

The Sigma model has been open-sourced on Hugging Face. Weights, dataset, some scripts, and logs are all available. The link is: https://huggingface.co/Veltraxor/Sigma