BI-MDRG:构建多模态对话响应生成中的图像历史信息
人工智能
2024-08-13 v1 机器学习
多媒体
摘要
多模态对话响应生成(MDRG)是近期提出的任务,需要根据对话上下文生成文本、图像或两者的混合响应。由于缺乏专为该任务设计的大规模数据集以及利用强大预训练模型的优势,以往的工作依赖文本模态作为图像输入和输出的中介步骤,而非采用端到端方法。然而,这种方法会忽略关于图像的关键信息,阻碍 1)基于图像的文本响应和 2)图像响应中对象的一致性。在本文中,我们提出了 BI-MDRG,通过桥接响应生成路径,利用图像历史信息以增强文本响应对图像内容的相关性以及图像响应中对象的一致性。通过在多模态对话基准数据集上的大量实验,我们展示了 BI-MDRG 能有效提高多模态对话的质量。此外,鉴于评估多模态对话中图像一致性的基准数据集存在差距,我们创建了一个包含 300 组对话的精选数据集,以跟踪跨对话中对象的一致性。
引用
@article{arxiv.2408.05926,
title = {BI-MDRG: Bridging Image History in Multimodal Dialogue Response Generation},
author = {Hee Suk Yoon and Eunseop Yoon and Joshua Tian Jin Tee and Kang Zhang and Yu-Jung Heo and Du-Seong Chang and Chang D. Yoo},
journal= {arXiv preprint arXiv:2408.05926},
year = {2024}
}
备注
ECCV 2024