面向语言复杂文本图像检索的神经分治推理框架
计算与语言
2023-05-08 v2
摘要
预训练视觉-语言模型(VLMs)在从文本检索图像方面已取得卓越性能。然而,当面对难以理解的语言复杂文本时,其性能急剧下降。受分治算法与双过程理论启发,本文将语言复杂文本视为由多个简单命题句构成的复合命题文本,并提出一种端到端神经分治推理框架,称为 NDCR。它包含三个主要组件:1)分:命题生成器将复合命题文本划分为简单命题句并生成其对应表示;2)治:基于预训练 VLMs 的视觉-语言交互器实现分解后的命题句与图像之间的交互;3)合:神经符号推理器通过神经逻辑推理方法组合上述推理状态以获得最终解。依据双过程理论,视觉-语言交互器与神经符号推理器可分别视为类比推理系统 1 与逻辑推理系统 2。我们在具有挑战性的上下文描述图像检索数据集上进行了充分实验。实验结果与分析表明 NDCR 在复杂图文推理问题上显著提升了性能。代码链接:https://github.com/YunxinLi/NDCR。
引用
@article{arxiv.2305.02265,
title = {A Neural Divide-and-Conquer Reasoning Framework for Image Retrieval from Linguistically Complex Text},
author = {Yunxin Li and Baotian Hu and Yuxin Ding and Lin Ma and Min Zhang},
journal= {arXiv preprint arXiv:2305.02265},
year = {2023}
}
备注
Accepted to ACL 2023 Main Conference