BrandFusion:用于无缝品牌集成的文本到视频生成的多智能体框架
计算机视觉与模式识别
2026-03-12 v2 人工智能
摘要
文本到视频 (T2V) 模型的快速发展已彻底改变了内容创建,但其商业潜力仍未得到充分发挥。我们首次提出在 T2V 中实现无缝品牌集成的任务:自动将广告品牌嵌入提示生成的视频中,同时保持对用户意图的语义忠实度。这一任务面临三个核心挑战:维持提示忠实度、确保品牌可识别性以及实现情境自然集成。为解决这些问题,我们提出了 BrandFusion,一种新型多智能体框架,包含两个协同的阶段。在离线阶段 (面向广告方),我们通过探测模型偏见并通过轻量级微调适应新型品牌来构建品牌知识库。在在线阶段 (面向用户),五个智能体通过迭代细化利用共享知识库和实时情境跟踪,确保品牌可见性和语义对齐。实验在 18 个既有品牌和 2 个自定义品牌上进行,涵盖多个最先进的 T2V 模型,表明 BrandFusion 在语义保持、品牌可识别性和集成自然性方面显著优于基线方法。人类评估进一步确认用户满意度更高,为可持续的 T2V 商业化提供了实际路径。
引用
@article{arxiv.2603.02816,
title = {BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation},
author = {Zihao Zhu and Ruotong Wang and Siwei Lyu and Min Zhang and Baoyuan Wu},
journal= {arXiv preprint arXiv:2603.02816},
year = {2026}
}