中文

通过变分信息瓶颈在无标签机器人视频上增强动作信息

机器人学 2025-08-13 v1

摘要

从演示中学习(LfD)通常依赖大量带有动作标签的专家轨迹,这从根本上限制了可用训练数据的规模。一种有前景的替代方案是直接从无标签的视频演示中学习。然而,我们发现现有方法倾向于编码与真实机器人动作互信息较低的隐动作,导致控制性能欠佳。为解决这一局限,我们引入了一个新颖的框架,即使在缺少动作标签的情况下,也能显式最大化隐动作与真实动作之间的互信息。我们的方法利用变分信息瓶颈来提取与动作相关的表征,同时丢弃与任务无关的信息。我们提供的理论分析表明,我们的目标函数确实最大化了隐动作与真实动作之间的互信息。最后,我们通过大量实验验证了我们的方法:首先在模拟机器人环境中,然后在真实世界的机器人平台上,实验结果表明,我们的方法显著增强了互信息,并持续提升了策略性能。

关键词

引用

@article{arxiv.2508.08743,
  title  = {Boosting Action-Information via a Variational Bottleneck on Unlabelled Robot Videos},
  author = {Haoyu Zhang and Long Cheng},
  journal= {arXiv preprint arXiv:2508.08743},
  year   = {2025}
}