Physion++:评估需要在线推断不同物理属性的物理场景理解
计算机视觉与模式识别
2023-11-03 v2 人工智能
图形学
机器人学
摘要
通用物理场景理解需要的不仅仅是定位和识别物体——它要求知道物体可以具有不同的潜在属性(例如质量或弹性),且这些属性会影响物理事件的结果。尽管近年来物理与视频预测模型取得了巨大进展,但测试其性能的基准通常不需要理解物体具有个体物理属性,或至多仅测试那些可直接观测的属性(例如尺寸或颜色)。本工作提出了一个称为Physion++的新数据集与基准,在预测依赖于对场景中物体潜在物理属性的准确估计的情况下,严格评估人工系统的视觉物理预测。具体而言,我们测试准确预测依赖于质量、摩擦、弹性和可变形性等属性估计的场景,且这些属性的值只能通过观察物体如何移动并与其他物体或流体相互作用来推断。我们评估了一系列涵盖不同学习与内置知识水平的最先进预测模型,并将该性能与一组人类预测进行比较。我们发现,使用标准机制与数据集训练的模型不会自发学习对潜在属性进行推断,但编码物体性与物理状态的模型往往做出更好的预测。然而,所有模型与人类性能之间仍存在巨大差距,且所有模型的预测与人类的预测相关性很差,表明没有最先进模型以类人方式学习进行物理预测。项目页面:https://dingmyu.github.io/physion_v2/
引用
@article{arxiv.2306.15668,
title = {Physion++: Evaluating Physical Scene Understanding that Requires Online Inference of Different Physical Properties},
author = {Hsiao-Yu Tung and Mingyu Ding and Zhenfang Chen and Daniel Bear and Chuang Gan and Joshua B. Tenenbaum and Daniel LK Yamins and Judith E Fan and Kevin A. Smith},
journal= {arXiv preprint arXiv:2306.15668},
year = {2023}
}
备注
Accepted by NeurIPS 2023 Datasets and Benchmarks Track