ZRIGF:一种用于零资源图像接地对话生成的创新多模态框架
计算与语言
2023-08-03 v2 多媒体
摘要
图像接地对话系统极大受益于视觉信息的整合,从而产生高质量的回复生成。然而,当前模型在零资源场景下难以有效利用此类信息,主要源于图像与文本模态间的差异。为克服这一挑战,我们提出一种称为 ZRIGF 的创新多模态框架,其在零资源情形下吸收图像接地信息用于对话生成。ZRIGF 实施两阶段学习策略,包括对比预训练与生成式预训练。对比预训练包含一个将图像与文本映射至统一编码向量空间的图像-文本匹配模块,以及一个保留预训练视觉特征并促进进一步多模态特征对齐的文本辅助掩码图像建模模块。生成式预训练采用多模态融合模块与信息迁移模块,基于协调的多模态表示生成有见地的回复。在基于文本与图像接地的对话数据集上进行的综合实验证明了 ZRIGF 在生成上下文相关且信息丰富回复方面的有效性。此外,我们在图像接地对话数据集中采用完全零资源场景,以展示我们的框架在新领域中的鲁棒泛化能力。代码见 https://github.com/zhangbo-nlp/ZRIGF。
引用
@article{arxiv.2308.00400,
title = {ZRIGF: An Innovative Multimodal Framework for Zero-Resource Image-Grounded Dialogue Generation},
author = {Bo Zhang and Jian Wang and Hui Ma and Bo Xu and Hongfei Lin},
journal= {arXiv preprint arXiv:2308.00400},
year = {2023}
}
备注
ACM Multimedia 2023 Accpeted, Repo: https://github.com/zhangbo-nlp/ZRIGF