MoEMoE:面向多源多模态问答的问题引导稠密与可扩展稀疏混合专家模型
计算与语言
2025-03-11 v1 机器学习
摘要
问答(QA)与视觉问答(VQA)是语言和视觉领域中研究充分的问题。一个具有挑战性的场景涉及多个信息源,每个信息源具有不同的模态,其中问题的答案可能存在于一个或多个源中。该场景包含更丰富的信息,但处理起来高度复杂。在本工作中,我们在包含多源、多模态信息的环境中构建了一个新颖的问答生成(QAG)框架。答案可能属于任意或所有源;因此,为给定问题选择最突出的答案源或所有源的最优组合具有挑战性。为解决这一问题,我们提出了一种问题引导的注意力机制,该机制学习跨多个源的注意力并解码此信息以实现稳健且无偏的答案生成。为了学习每个源内的注意力,我们引入了问题与各种信息源之间的显式对齐,这有助于识别相对于问题最相关的源信息部分。在处理多样化问题时的可扩展性是一个挑战。我们通过将模型扩展至稀疏混合专家(sparse-MoE)框架来解决这一问题,使其能够处理数千种问题类型。在三个数据集上使用 T5 和 Flan-T5 的实验证明了该模型的有效性,并得到了消融研究的支持。
引用
@article{arxiv.2503.06296,
title = {MoEMoE: Question Guided Dense and Scalable Sparse Mixture-of-Expert for Multi-source Multi-modal Answering},
author = {Vinay Kumar Verma and Shreyas Sunil Kulkarni and Happy Mittal and Deepak Gupta},
journal= {arXiv preprint arXiv:2503.06296},
year = {2025}
}
备注
To appear at NAACL Industry Track