中文

D-最优性引导的强化学习用于三自由度踝关节康复机器人高效开环标定

机器人学 2026-01-23 v1

摘要

多自由度康复机器人的精确对准对于安全有效的患者训练至关重要。本文为自行设计的三自由度(3-DOF)踝关节康复机器人提出了一种两阶段标定框架。首先,开发了一种基于克罗内克积的开环标定方法,将输入-输出对准转化为线性参数辨识问题,进而通过所得信息矩阵定义了相关的实验设计目标。基于此公式,标定位姿选择被构建为一个由D-最优性准则引导的组合实验设计问题,即选择一小部分位姿以最大化信息矩阵的行列式。为在约束条件下实现实际选择,我们在仿真中训练了一个近端策略优化(PPO)智能体,使其从50个候选位姿中选择4个信息量最大的位姿。在仿真和真实机器人评估中,学习到的策略始终产生比随机选择信息量大得多的位姿组合:据报道,PPO实现的信息矩阵平均行列式比随机选择高出两个数量级以上,且方差更小。此外,真实世界的结果表明,仅从四个D-最优性引导的位姿中识别出的参数向量,比从更大但非结构化的50个位姿集合中获得的估计值具有更强的跨回合预测一致性。因此,所提出的框架在保持鲁棒参数估计的同时提高了标定效率,为多自由度康复机器人的高精度对准提供了实用指导。

关键词

引用

@article{arxiv.2601.15707,
  title  = {D-Optimality-Guided Reinforcement Learning for Efficient Open-Loop Calibration of a 3-DOF Ankle Rehabilitation Robot},
  author = {Qifan Hu and Branko Celler and Weidong Mu and Steven W. Su},
  journal= {arXiv preprint arXiv:2601.15707},
  year   = {2026}
}