中文

适配视觉问答模型以增强多模态社区问答平台

计算与语言 2019-05-28 v2 人工智能 计算机视觉与模式识别

摘要

问题分类与专家检索方法对社区问答(CQA)平台中的信息组织与可获取性至关重要。然而,该领域研究仅处理了文本模态。随着网络内容多模态性的增强,我们致力于将这些方法扩展至配有图像的CQA问题。具体而言,我们利用视觉问答(VQA)领域中文本与图像表示学习的成功,并适配其底层概念与架构,用于对发布于Yahoo! Chiebukuro(Yahoo! Answers的日本对应平台)的基于图像的问题进行自动类别分类与专家检索。据我们所知,这是首项应对CQA中多模态挑战、并将VQA模型适配于更具生态效度的视觉问题来源任务的工作。我们对视觉QA与社区QA数据差异的分析驱动了针对CQA定制的注意力方法的新颖增强方案,以及利用辅助任务学习更好接地特征的提议。我们的最终模型在真实世界多模态CQA数据的分类与专家检索两项任务上均显著优于仅文本与VQA模型基线。

关键词

引用

@article{arxiv.1808.09648,
  title  = {Adapting Visual Question Answering Models for Enhancing Multimodal Community Q&A Platforms},
  author = {Avikalp Srivastava and Hsin Wen Liu and Sumio Fujita},
  journal= {arXiv preprint arXiv:1808.09648},
  year   = {2019}
}

备注

Submitted for review at CIKM 2019