使用预训练单模态模型的 SIMMC 2.0 多模态交互
计算与语言
2021-12-21 v3 人工智能
摘要
本文介绍了我们在第 10 届对话状态跟踪挑战(DSTC 10)上举办的情境化交互式多模态对话 2.0(SIMMC 2.0)任务中的工作。SIMMC 2.0 包含 4 个子任务,我们针对子任务 #1、#2 以及子任务 #4 的生成提出了多模态方法。SIMMC 2.0 数据集是一个包含图像与文本信息的多模态数据集,其比仅基于文本的对话问题更具挑战性,因为它必须通过理解图像与文本之间的关系来解决。因此,由于仅使用 BERT 或 GPT2 等文本模型存在局限,我们提出了一种结合图像与文本的多模态模型。我们首先预训练该多模态模型以理解图像与文本之间的关系,然后针对每个任务微调我们的模型。我们在子任务 #1、#2 中取得第 3 佳性能,并在子任务 #4 的生成中取得亚军。源代码见 https://github.com/rungjoo/simmc2.0。
引用
@article{arxiv.2112.05328,
title = {Multimodal Interactions Using Pretrained Unimodal Models for SIMMC 2.0},
author = {Joosung Lee and Kijong Han},
journal= {arXiv preprint arXiv:2112.05328},
year = {2021}
}
备注
Accepted to DSTC10 challenge wokrshop at AAAI 2022