AssetGen:交互式速度下的可部署 3D 资产生成
声音
2026-05-27 v1 人工智能
摘要
雖然 3D 生成正在快速進步,但近期研究常聚焦於取得高解析度資產,將使用者體驗與可部署性當作後思考的議題。我們提出 AssetGen,專注於這兩個方面。給定一張參考圖像,30 秒內產生高品質網格、烤切法線、色彩貼圖,並具備適合即時渲染(包括行動設備使用)的受控多邊形預算。AssetGen Flash 變體進一步將延遲縮減至 14 秒,以滿足交互式與代理人創作循環的需求。我們的模型採用粗到細的 VecSet 框架生成物件幾何,該框架在 GPU 上實現網格簡化、清理與法線烤製,並支援快速平行 UV 解包。隨後以多視角方式生成紋理, followed by backprojection 與 3D 填充。模型蒸餾、核心優化與管道並行化協同設計,以加速系統端到端運作。我們引入大量自動化與盲人人類評估,並在 30 秒內展示與領先商業解決方案具競爭的視覺品質,15 秒內呈現預覽品質結果。最終產出是一個支援 AI 輔助、可部署於交互式工作流程中的 3D 內容創作系統。
引用
@article{arxiv.2605.26136,
title = {Eroding Trust in Real Speech: A Large-Scale Study of Human Audio Deepfake Perception},
author = {Nicolas M. Müller and Wei Herng Choong},
journal= {arXiv preprint arXiv:2605.26136},
year = {2026}
}