中文

ZeroGen:基于多预言机的零样本多模态可控文本生成

计算与语言 2023-06-30 v1

摘要

自动生成具有期望属性的文本内容是一个人们长期追求的高远任务。现有工作在将单模态控制引入语言模型(LMs)方面取得了一系列进展,而如何用多模态信号以高效率生成可控句子仍是一个开放问题。为破解该难题,我们提出一种多模态信号零样本可控文本生成新范式(\textsc{ZeroGen})。具体而言,\textsc{ZeroGen}在解码时从词元级到句子级依次利用文本与图像的控制,并将其映射至统一概率空间,通过加权相加定制LM输出而无需额外训练。为实现更好的模态间权衡,我们进一步引入有效的动态加权机制来调节所有控制权重。此外,我们进行了充分实验以探究来自不同模态的信号在深度与宽度上的关系。在三个下游任务上的令人鼓舞的实证结果表明,\textsc{ZeroGen}不仅在描述任务上大幅优于同类方法,还在具有更高控制度的多模态新闻生成中展现出巨大潜力。我们的代码将发布于https://github.com/ImKeTT/ZeroGen。

关键词

引用

@article{arxiv.2306.16649,
  title  = {ZeroGen: Zero-shot Multimodal Controllable Text Generation with Multiple Oracles},
  author = {Haoqin Tu and Bowen Yang and Xianfeng Zhao},
  journal= {arXiv preprint arXiv:2306.16649},
  year   = {2023}
}

备注

17 pages, preprint