多模态经验启发的AI创作
人工智能
2024-09-05 v2
摘要
诗歌或歌词生成等AI创作近年来引起了工业界与学术界的日益关注,过去几年中提出了许多有前景的模型。现有方法通常基于单一且独立的视觉或文本信息来生成输出。然而在现实中,人类通常依据自身经验进行创作,这些经验可能涉及不同模态且呈序列相关性。为建模此类人类能力,本文定义并求解了一个基于人类经验的新型AI创作问题。更具体地,我们研究如何基于序列多模态信息生成文本。相较以往工作,该任务困难得多,因为所设计的模型必须充分理解并适配不同模态间的语义,并以序列方式将其有效转换为输出。为缓解这些困难,我们首先设计了一个配备多模态注意力网络的多通道序列到序列架构。为获得更有效的优化,我们进而提出了一种针对序列输入的课程负采样策略。为对该问题进行基准测试并证明模型有效性,我们人工标注了一个全新的多模态经验数据集。基于该数据集,我们通过将模型一系列代表性基线进行比较开展了大量实验,基于自动与以人为中心的指标均显示出模型的显著改进。代码与数据见:\url{https://github.com/Aman-4-Real/MMTG}。
引用
@article{arxiv.2209.02427,
title = {Multi-Modal Experience Inspired AI Creation},
author = {Qian Cao and Xu Chen and Ruihua Song and Hao Jiang and Guang Yang and Zhao Cao},
journal= {arXiv preprint arXiv:2209.02427},
year = {2024}
}
备注
Accepted by ACM Multimedia 2022