视觉文本理解与生成的和谐化
计算机视觉与模式识别
2024-10-24 v2
摘要
本文提出TextHarmony,一个统一且多功能的多模态生成模型,能够熟练地理解和生成视觉文本。同时生成图像和文本通常会因视觉与语言模态之间的内在不一致而导致性能下降。为克服这一挑战,现有方法会采用特定模态的数据进行监督式微调, necessitating 不同的模型实例。我们提出了Slide-LoRA,通过动态聚合模态特定数据和模态中性LoRA专家,部分解耦多模态生成空间。Slide-LoRA将视觉和语言的生成在单个模型实例中进行和谐,从而促进更统一的生成过程。此外,我们开发了一个高质量的图像描述数据集——DetailedTextCaps-100K,该数据集使用高级闭源多模态大语言模型合成,以进一步提升视觉文本生成能力。广泛的实验表明,所提方法有效。通过Slide-LoRA,TextHarmony仅需增加2%的参数,即可达到与模态特定微调相当的性能,在视觉文本理解任务中平均提升2.5%,在视觉文本生成任务中平均提升4.0%。我们的工作阐明了在视觉文本领域实现集成式多模态生成的可行性,为后续研究奠定了基础。代码已公开于https://github.com/bytedance/TextHarmony。
引用
@article{arxiv.2407.16364,
title = {Harmonizing Visual Text Comprehension and Generation},
author = {Zhen Zhao and Jingqun Tang and Binghong Wu and Chunhui Lin and Shu Wei and Hao Liu and Xin Tan and Zhizhong Zhang and Can Huang and Yuan Xie},
journal= {arXiv preprint arXiv:2407.16364},
year = {2024}
}
备注
accepted by NeurIPS 2024