中文

KAN We Flow? 基于 KAN 与 RWKV 的 3D 流匹配提升机器人操作

机器人学 2026-02-16 v2 计算机视觉与模式识别

摘要

基于扩散的视觉运动策略在建模动作分布方面表现出色,但因需要从噪声递归去噪到策略的多个步骤和重型 UNet 主干,导致推理效率低下,阻碍了资源受限机器人的部署。流匹配通过学习一步向量场来缓解采样负担,但以往实现仍继承大型 UNet 风格架构。本文提出 KAN-We-Flow,一种基于 RWKV 和 Kolmogorov-Arnold 网络(KAN)从视觉到操作构建轻量且高度表达的主干的流匹配策略。具体而言,我们引入了 RWKV-KAN 模块:RWKV 首先执行高效的时间/通道混合以传播任务上下文,随后通过 GroupKAN 层应用可学习的样条基函数的、按组的功能映射,对 RWKV 输出上的动作映射进行特征级非线性校准。此外,我们引入了 Action Consistency Regularization(ACR),一种轻量级辅助损失,通过欧拉外推 enforce 预测动作轨迹与专家演示的一致性,提供额外的监督以稳定训练并提高策略精度。不诉诸大型 UNet,我们的设计减少了 86.8% 的参数,保持快速运行时,同时在 Adroit、Meta-World 和 DexArt 基准测试中实现了最先进的成功率。我们的项目页面可在 \href{https://zhihaochen-2003.github.io/KAN-We-Flow.github.io/}{\textcolor{red}{link}} 查看。

关键词

引用

@article{arxiv.2602.01115,
  title  = {KAN We Flow? Advancing Robotic Manipulation with 3D Flow Matching via KAN & RWKV},
  author = {Zhihao Chen and Yiyuan Ge and Ziyang Wang},
  journal= {arXiv preprint arXiv:2602.01115},
  year   = {2026}
}

备注

Accepted By ICRA2026