适配视觉问答模型以增强多模态社区问答平台
计算与语言
2019-05-28 v2 人工智能
计算机视觉与模式识别
摘要
问题分类与专家检索方法对社区问答(CQA)平台中的信息组织与可获取性至关重要。然而,该领域研究仅处理了文本模态。随着网络内容多模态性的增强,我们致力于将这些方法扩展至配有图像的CQA问题。具体而言,我们利用视觉问答(VQA)领域中文本与图像表示学习的成功,并适配其底层概念与架构,用于对发布于Yahoo! Chiebukuro(Yahoo! Answers的日本对应平台)的基于图像的问题进行自动类别分类与专家检索。据我们所知,这是首项应对CQA中多模态挑战、并将VQA模型适配于更具生态效度的视觉问题来源任务的工作。我们对视觉QA与社区QA数据差异的分析驱动了针对CQA定制的注意力方法的新颖增强方案,以及利用辅助任务学习更好接地特征的提议。我们的最终模型在真实世界多模态CQA数据的分类与专家检索两项任务上均显著优于仅文本与VQA模型基线。
引用
@article{arxiv.1808.09648,
title = {Adapting Visual Question Answering Models for Enhancing Multimodal Community Q&A Platforms},
author = {Avikalp Srivastava and Hsin Wen Liu and Sumio Fujita},
journal= {arXiv preprint arXiv:1808.09648},
year = {2019}
}
备注
Submitted for review at CIKM 2019