面向外部知识视觉问答的段落检索
信息检索
2021-05-11 v1
摘要
在这项工作中,我们通过关注面向外部知识视觉问答的段落检索,处理包含文本问题与图像的多模态信息需求。该任务需要访问外部知识,在我们这里定义为一个大型非结构化段落集合。我们首先使用 BM25 进行稀疏检索,并研究用物体名称与图像描述扩展问题。我们验证了视觉线索发挥重要作用,且在稀疏检索中描述往往比物体名称更具信息量。随后我们构建了一个双编码器稠密检索器,其查询编码器为 LXMERT(一种多模态预训练 transformer)。我们进一步表明,稠密检索显著优于使用物体扩展的稀疏检索。此外,稠密检索可达到利用人工生成描述的稀疏检索的性能。
引用
@article{arxiv.2105.03938,
title = {Passage Retrieval for Outside-Knowledge Visual Question Answering},
author = {Chen Qu and Hamed Zamani and Liu Yang and W. Bruce Croft and Erik Learned-Miller},
journal= {arXiv preprint arXiv:2105.03938},
year = {2021}
}
备注
Accepted to SIGIR'21 as a short paper