XR 环境下的多模态草图到网格生成:MS2Mesh-XR
计算机视觉与模式识别
2024-12-13 v1 人机交互
多媒体
摘要
我们提出了 MS2Mesh-XR,一种新型的多模态草图到网格生成管道,使用户能够通过手绘草图(辅以语音输入)在延长现实(XR)环境中创建逼真的 3D 对象。具体而言,用户可通过在虚拟环境中进行自然的手部运动直观地绘制对象。通过整合语音输入,我们设计了 ControlNet 以基于绘制的草图和解释文本提示推断逼真的图像。用户随后可以审阅并选择其首选图像,该图像随后使用卷积重建模型被重建为详细的 3D 网格。值得注意的是,我们提出的管道能在不到 20 秒的时间内生成高质量的 3D 网格,允许在运行时 XR 场景中进行沉浸式可视化和操作。我们通过 XR 环境中的两个用例演示了该管道的可行性。通过利用自然的用户输入和最前沿的生成式 AI 技能,我们的方法显著促进了基于 XR 的创意生产,并提升了用户体验。我们的代码和演示将在 https://yueqiu0911.github.io/MS2Mesh-XR/ 提供。
关键词
引用
@article{arxiv.2412.09008,
title = {MS2Mesh-XR: Multi-modal Sketch-to-Mesh Generation in XR Environments},
author = {Yuqi Tong and Yue Qiu and Ruiyang Li and Shi Qiu and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2412.09008},
year = {2024}
}
备注
IEEE AIxVR 2025