下一帧预测在学习物理定律中的能力
计算机视觉与模式识别
2024-05-29 v1 机器学习
摘要
下一帧预测是一种用于建模和理解视频数据动态的有效且强大的方法。受因果语言建模和语言建模中下一词元预测的经验成功启发,我们探索了下一帧预测在多大程度上可以作为一种强大的基础学习策略(类似于语言建模),以诱导对视觉世界的理解。为了量化下一帧预测所诱导的具体视觉理解能力,我们引入了六个诊断模拟视频数据集,这些数据集源自基本物理定律,通过改变重力和质量等物理常数创建。我们证明,仅在下一帧预测任务上训练的模型能够预测这些物理常数(如重力)的值,而无需通过回归任务直接训练模型去学习这些常数。我们发现,仅生成训练阶段就诱导出一种模型状态,其预测物理常数的能力显著优于随机模型,将损失降低了 1.28 至 6.24 倍。我们得出结论,下一帧预测作为一种通用学习策略展现出巨大前景,它能够在无需显式标注的情况下诱导对支配视觉领域的诸多“定律”的理解。
引用
@article{arxiv.2405.17450,
title = {The Power of Next-Frame Prediction for Learning Physical Laws},
author = {Thomas Winterbottom and G. Thomas Hudson and Daniel Kluvanec and Dean Slack and Jamie Sterling and Junjie Shentu and Chenghao Xiao and Zheming Zhou and Noura Al Moubayed},
journal= {arXiv preprint arXiv:2405.17450},
year = {2024}
}
备注
7 Figures, 12 Pages, 1 Table