中文

BLaDA:在3DGS场中桥接语言到功能灵巧动作

计算机视觉与模式识别 2026-04-15 v2 机器人学

摘要

在非结构化环境中,功能灵巧抓取需要语义理解、精确3D功能定位和可解释执行之间的紧密集成。模块化层次方法比端到端的VLA方法更可控且更易解释,但现有方法仍依赖预定义的功能标签,缺乏实现功能灵巧操控所需的语义-姿态紧密耦合。为此,我们提出BLaDA(Bridging Language to Dexterous Actions in 3DGS fields),一个可解释的零样本框架,将开放词汇指令 grounding 为感知和控制约束,用于功能灵巧操控。BLaDA通过Knowledge-guided Language Parsing (KLP)模块将自然语言解析为结构化的六元组操作约束。为实现姿态一致的空间推理,我们引入Triangular Functional Point Localization (TriLocation)模块,利用3D高斯溶解作为连续场景表示,并在三角几何约束下识别功能区域。最后,3D关键点抓握矩阵变换执行(KGT3D+)模块将这些语义-几何约束解码为可行的手腕姿态和手指级命令。在复杂基准测试上,实验表明BLaDA在功能 affordance grounding 精度和功能操控成功率方面显著优于现有方法。代码将公开于https://github.com/PopeyePxx/BLaDA。

关键词

引用

@article{arxiv.2604.08410,
  title  = {BLaDA: Bridging Language to Functional Dexterous Actions within 3DGS Fields},
  author = {Fan Yang and Wenrui Chen and Guorun Yan and Ruize Liao and Wanjun Jia and Dongsheng Luo and Jiacheng Lin and Kailun Yang and Zhiyong Li and Yaonan Wang},
  journal= {arXiv preprint arXiv:2604.08410},
  year   = {2026}
}

备注

Code will be publicly available at https://github.com/PopeyePxx/BLaDA