基于结构持久状态的最优资源分配用于音乐视频生成
计算机视觉与模式识别
2026-05-12 v1 人工智能
机器学习
多智能体系统
摘要
生成长时段音乐视频(MV)常受计算成本高昂且难以维持跨镜头一致性的约束。我们提出AllocMV,一个层次化框架,将音乐视频合成表述为多选背包问题(MCKP)。AllocMV将视频的持久状态表示为由字符实体、场景先验和共享图组成的紧凑、结构化对象,由全局规划器在实现之前生成。通过从多模态线索估计片段突出度,基于动态编程的群级MCKP求解器最优分配资源至High-Gen、Mid-Gen和Reuse分支。对于重复的音乐动机,我们实施基于收敛的分支策略以复用视觉前缀以降低成本,同时确保动机级连续性。在Cost-Quality Ratio(CQR)评估下,AllocMV实现了严格预算和节奏约束下感知质量与资源支出之间的最优权衡。
引用
@article{arxiv.2605.10723,
title = {AllocMV: Optimal Resource Allocation for Music Video Generation via Structured Persistent State},
author = {Huimin Wang and Leilei Ouyang and Chang Xia and Yongqi Kang and Yu Fu and Yuqi Ouyang},
journal= {arXiv preprint arXiv:2605.10723},
year = {2026}
}