MULTIBENCH++: 跨专业领域的统一综合多模态融合基准
机器学习
2026-05-07 v3
摘要
尽管多模态融合取得了显著进展,但其发展受到评估基准不足的制约。当前的融合方法通常仅在小规模公开数据集上进行评估,这种局限性未能充分代表真实场景的复杂性与多样性,可能导致偏倚的评估。该问题呈双重挑战:一方面,模型可能过拟合于特定数据集的偏差,限制其在更广泛实际应用中的泛化;另一方面,缺乏统一的评估标准,使得不同融合方法的公正客观比较困难。因此,尚未出现真正通用且高性能的融合模型。为此,我们开发了一个大规模、领域自适应的多模态评估基准。该基准集成了超过 30 个数据集,覆盖 15 种模态和 20 项预测任务,涵盖多个关键应用领域。此外,我们还开发了一个开源的、统一的、自动化的评估管道,包含最新模型的标准实现以及多样化的融合范式。依托该平台,我们进行了大规模实验,成功建立了多个任务上的新性能基准。本工作为学术界提供了一个严谨可复现的多模态模型评估平台,旨istically 拉动多模态人工智能领域迎来新高度。
引用
@article{arxiv.2511.06452,
title = {MULTIBENCH++: A Unified and Comprehensive Multimodal Fusion Benchmarking Across Specialized Domains},
author = {Leyan Xue and Changqing Zhang and Kecheng Xue and Xiaohong Liu and Guangyu Wang and Zongbo Han},
journal= {arXiv preprint arXiv:2511.06452},
year = {2026}
}
备注
AAAI 2026