KAM-CoT:知识增强的多模态思维链推理
计算与语言
2024-01-24 v1 人工智能
摘要
大型语言模型(LLMs)通过启用逐步思考的思维链在自然语言处理任务中展现出了令人瞩目的性能。将 LLMs 扩展至多模态能力是近期的关注点,但这会带来计算成本并需要大量的硬件资源。为了应对这些挑战,我们提出了 KAM-CoT,一个整合了 CoT 推理、知识图谱和多种模态的框架,以全面理解多模态任务。KAM-CoT 采用带有 KG 基础的两阶段训练过程,以生成有效的依据和答案。通过在推理过程中从 KGs 引入外部知识,模型获得了更深入的上下文理解,减少了幻觉并提高了答案质量。这种知识增强的 CoT 推理使模型能够处理需要外部上下文的问题,提供更明智的答案。实验结果表明 KAM-CoT 优于现有最先进的方法。在 ScienceQA 数据集上,我们实现了 93.87% 的平均准确率,超过 GPT-3.5(75.17%)18%,超过 GPT-4(83.99%)10%。值得注意的是,KAM-CoT 仅用 280M 可训练参数就实现了这些结果,证明了其成本效益和有效性。
引用
@article{arxiv.2401.12863,
title = {KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning},
author = {Debjyoti Mondal and Suraj Modi and Subhadarshi Panda and Rituraj Singh and Godawari Sudhakar Rao},
journal= {arXiv preprint arXiv:2401.12863},
year = {2024}
}
备注
AAAI 2024