SPRING:基于增量布局图多模态问题预训练的场景对话智能体
计算与语言
2023-01-06 v1 人工智能
计算机视觉与模式识别
机器学习
多媒体
摘要
现有的多模态对话智能体已展现出在简单场景中定位绝对位置或检索属性的出色能力,但当涉及复杂的相对位置与信息对齐时表现不佳,这构成了回复质量的瓶颈。本文提出一种基于增量布局图多模态问题预训练的场景对话智能体(SPRING),其具备在拥挤场景中对多跳空间关系进行推理并将其与视觉属性相关联的能力。具体而言,我们设计了两类多模态问答(MQA)任务来预训练该智能体。预训练所用的所有问答对均由新颖的增量布局图(ILG)生成。ILG 自动标注的问答对难度标签被用于促进基于 MQA 的课程学习。实验结果验证了 SPRING 的有效性,表明其在 SIMMC 1.0 与 SIMMC 2.0 数据集上均显著优于最先进的方法。
引用
@article{arxiv.2301.01949,
title = {SPRING: Situated Conversation Agent Pretrained with Multimodal Questions from Incremental Layout Graph},
author = {Yuxing Long and Binyuan Hui and Fulong Ye and Yanyang Li and Zhuoxin Han and Caixia Yuan and Yongbin Li and Xiaojie Wang},
journal= {arXiv preprint arXiv:2301.01949},
year = {2023}
}
备注
AAAI 2023