MVLLaVA: 用于统一且灵活的新视角合成的智能体
计算机视觉与模式识别
2024-09-12 v1
摘要
本文介绍了 MVLLaVA, 一个用于新视角合成任务的智能体。MVLLaVA 将多个多视角扩散模型与大型多模态模型 LLaVA 集成,使其能够高效地处理广泛的任务。MVLLaVA 是一个灵活且统一的平台,能够适应多种输入类型,包括单张图像、描述性说明或特定的观察方位角变化,通过语言指令引导视点生成。我们仔细构建了任务特定的指令模板,随后用于微调 LLaVA。结果使 MVLLaVA 能够基于用户指令生成新视角图像,展现出在多样化任务中的灵活性。实验验证了 MVLLaVA 的有效性,证明其在应对多样化的新视角合成挑战方面表现稳健且具有多样性。
引用
@article{arxiv.2409.07129,
title = {MVLLaVA: An Intelligent Agent for Unified and Flexible Novel View Synthesis},
author = {Hanyu Jiang and Jian Xue and Xing Lan and Guohong Hu and Ke Lu},
journal= {arXiv preprint arXiv:2409.07129},
year = {2024}
}
备注
project page: https://jamesjg.github.io/MVLLaVA_homepage/