中文

FlexMUSE:面向创意写作的多模态统一与语义增强框架

计算机视觉与模式识别 2025-08-25 v1 人工智能

摘要

多模态创意写作(MMCW)旨在生成图文并茂的文章。与故事叙述或标题生成等常见的多模态生成(MMG)任务不同,MMCW 是一个全新的、更具抽象性的挑战,其中文本和视觉上下文之间并非严格关联。现有相关任务的方法可以强行迁移到该领域,但它们需要特定的模态输入或高昂的训练成本,且经常面临模态间的语义不一致问题。因此,主要挑战在于以经济的交互模式执行 MMCW,使输出模态间的语义更加对齐。在本工作中,我们提出了 FlexMUSE,并配备了一个 T2I 模块以实现可选的视觉输入。FlexMUSE 通过提出模态语义对齐门控(msaGate)来限制文本输入,从而促进创造力并强调模态间的统一。此外,提出了一种基于注意力的跨模态融合方法以增强输入特征,实现语义增强。FlexMUSE 内的模态语义创意直接偏好优化(mscDPO)通过扩展拒绝样本来促进写作创造力。此外,为推动 MMCW 的发展,我们发布了一个名为 ArtMUSE 的数据集,包含约 3k 个校准的文本-图像对。FlexMUSE 取得了有前景的结果,展示了其一致性、创造性和连贯性。

关键词

引用

@article{arxiv.2508.16230,
  title  = {FlexMUSE: Multimodal Unification and Semantics Enhancement Framework with Flexible interaction for Creative Writing},
  author = {Jiahao Chen and Zhiyong Ma and Wenbiao Du and Qingyuan Chuai},
  journal= {arXiv preprint arXiv:2508.16230},
  year   = {2025}
}