M$^3$CoT:面向多领域、多步骤、多模态思维链的新基准
计算机视觉与模式识别
2024-05-28 v1 人工智能
计算与语言
摘要
多模态思维链(MCoT)要求模型利用文本和视觉两种模态的知识进行逐步推理,这日益受到关注。然而,当前的MCoT基准仍面临一些挑战:(1)缺乏视觉模态推理,(2)单步视觉模态推理,以及(3)领域缺失,从而阻碍了MCoT的发展。受此启发,我们引入了一个新颖的基准(MCoT)来解决上述挑战,推进多领域、多步骤、多模态CoT的发展。此外,我们对视觉大语言模型(VLLM)上的大量MCoT方法进行了全面评估。另外,我们强调,尽管现有的VLLM在之前的MCoT基准上取得了优异的结果,但它们在MCoT上仍然难以正确推理,并且与人类表现之间仍存在巨大差距。据我们所知,我们在MCoT中向多领域、多步骤、多模态场景迈出了有意义的第一步。我们希望MCoT能够作为宝贵的资源,为多领域、多步骤、多模态思维链研究提供开创性的基础。
引用
@article{arxiv.2405.16473,
title = {M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought},
author = {Qiguang Chen and Libo Qin and Jin Zhang and Zhi Chen and Xiao Xu and Wanxiang Che},
journal= {arXiv preprint arXiv:2405.16473},
year = {2024}
}
备注
Accepted at ACL2024 Main Conference