CoFRIDA:用于人机协同绘画的自监督微调
机器人学
2024-02-22 v1
摘要
先前的机器人绘画和绘图工作(如 FRIDA)侧重于减小仿真到现实的差距并扩展用户的输入模态,但与这些系统的交互通常仅存在于输入阶段。为了支持交互式的人机协同绘画,我们引入了协同 FRIDA (CoFRIDA) 机器人绘画框架,该框架能够通过修改和参与人类协作者已绘制的内容来进行协同绘画。为了改善 FRIDA 的主要弱点即文本 - 图像对齐问题,我们的系统使用了预训练的文本到图像模型;然而,在现实世界协同绘画背景下,预训练模型表现不佳,因为它们 (1) 不理解机器人的约束和能力,(2) 无法在不进行不切实际的画布编辑和覆盖内容的情况下执行协同绘画。我们提出了一种自监督微调程序,可以解决这两个问题,从而允许将预训练的最先进文本 - 图像对齐模型与机器人结合使用,以实现物理世界中的协同绘画。我们的开源方法 CoFRIDA 创作的绘画和绘图比 FRIDA 更清晰地匹配输入文本提示,无论是从空白画布还是基于人类创作的作品开始。更广泛地说,我们的微调程序成功地将机器人的约束和能力编码到基础模型中,展示了作为减小仿真到现实差距的有效方法的良好前景。
引用
@article{arxiv.2402.13442,
title = {CoFRIDA: Self-Supervised Fine-Tuning for Human-Robot Co-Painting},
author = {Peter Schaldenbrand and Gaurav Parmar and Jun-Yan Zhu and James McCann and Jean Oh},
journal= {arXiv preprint arXiv:2402.13442},
year = {2024}
}