TPA-Net:生成用于文本到物理动画的数据集
人工智能
2022-11-28 v1 计算与语言
计算机视觉与模式识别
图形学
图像与视频处理
摘要
视觉-语言(V&L)联合研究近期的突破在各种文本驱动任务中取得了显著成果。长期被认为不可能完成的任务——高质量文本到视频(T2V),在最新工作中被证明可行且取得了合理良好的结果。然而,所得视频常具有不期望的伪影,很大程度上因为系统纯数据驱动且对物理定律无知。为解决此问题并进一步将 T2V 推向高层次物理真实感,我们提出了一种自主数据生成技术与一个数据集,旨在通过大量多模态 3D 文本到视频/仿真(T2V/S)数据缩小差距。数据集中,我们提供固体与流体的高分辨率 3D 物理仿真,以及物理现象的文本描述。我们利用最先进的物理仿真方法(i)增量势接触(IPC)与(ii)物质点法(MPM)来仿真多样场景,包括弹性变形、材料断裂、碰撞、湍流等。此外,为惠及 T2V、神经辐射场(NeRF)及其他社区,提供了高质量多视角渲染视频。本工作是迈向全自动化文本到视频/仿真(T2V/S)的第一步。实时示例与后续工作见 https://sites.google.com/view/tpa-net。
引用
@article{arxiv.2211.13887,
title = {TPA-Net: Generate A Dataset for Text to Physics-based Animation},
author = {Yuxing Qiu and Feng Gao and Minchen Li and Govind Thattai and Yin Yang and Chenfanfu Jiang},
journal= {arXiv preprint arXiv:2211.13887},
year = {2022}
}