中文

面向开放域多模态检索问答的渐进式证据精炼

人工智能 2023-10-17 v1

摘要

预训练多模态模型在基于检索的问答中已取得显著成功。然而,当前多模态检索问答模型面临两个主要挑战。首先,将压缩后的证据特征作为模型输入会导致证据内部细粒度信息的丢失。其次,证据的特征提取与问题之间存在鸿沟,阻碍了模型基于给定问题从证据中有效提取关键特征。我们提出一个用于证据检索与问答的两阶段框架以缓解这些问题。首先,我们提出一种渐进式证据精炼策略以筛选关键证据。该策略采用迭代式证据检索方法揭示各证据片段之间的逻辑顺序,并引入两轮过滤以优化解空间,从而进一步确保时间效率。随后,我们提出一种基于负样本的半监督对比学习训练策略以拓展问题域的范围,从而更充分地挖掘已知样本中的潜在知识。最后,为减轻细粒度信息的丢失,我们设计了一种多轮检索与问答策略来处理多模态输入。该策略将多模态证据作为历史对话与问题的一部分直接纳入模型。同时,我们利用跨模态注意力机制捕捉证据与问题之间的内在联系,并通过解码生成方式得出答案。我们通过大量实验验证了模型的有效性,在 WebQA 和 MultimodelQA 基准测试中取得了优异性能。

关键词

引用

@article{arxiv.2310.09696,
  title  = {Progressive Evidence Refinement for Open-domain Multimodal Retrieval Question Answering},
  author = {Shuwen Yang and Anran Wu and Xingjiao Wu and Luwei Xiao and Tianlong Ma and Cheng Jin and Liang He},
  journal= {arXiv preprint arXiv:2310.09696},
  year   = {2023}
}