中文

DegustaBot:面向个性化多目标重排的零样视觉偏好估计

计算机视觉与模式识别 2024-07-15 v1 机器人学

摘要

“De gustibus non est disputandum”(“他人口味无可争辩”)是一条描述生活中许多解决方案由个人偏好决定的拉丁语格言。许多家务任务,特别是要考虑个人偏好才能完全成功地完成,包括场景的视觉审美。例如,设桌子可通过依据西方餐桌摆设传统规则对器具进行排列优化,而不考虑每件物品的颜色、形状或材料,但这可能并非为特定人提供完全满意的解决方案。为此,我们提出DegustaBot,一个用于根据个人偏好解决家庭多目标重排任务的视觉偏好学习算法。为此,我们使用互联网规模的预训练视觉-语言基础模型(VLM)并采用 novel zero-shot visual prompting 技术。为评估我们的方法,我们收集了模拟餐桌设置任务中大量自然风格偏好的数据集,并进行用户研究,以develop 两种基于个人偏好确定成功性的 novel 指标。这是一个具有挑战性的问题,我们发现该模型预测结果的 50% 可能被至少 20%的人接受。

关键词

引用

@article{arxiv.2407.08876,
  title  = {DegustaBot: Zero-Shot Visual Preference Estimation for Personalized Multi-Object Rearrangement},
  author = {Benjamin A. Newman and Pranay Gupta and Kris Kitani and Yonatan Bisk and Henny Admoni and Chris Paxton},
  journal= {arXiv preprint arXiv:2407.08876},
  year   = {2024}
}

备注

19 pages, 10 figures