中文

面向轻量级多模态LLM的级联自评估增强训练

计算与语言 2025-03-18 v2 人工智能

摘要

高效多模态大语言模型(EMLLM)可以通过思维链推理提高性能,但它们在CoT推理过程中的自评估能力较差。这是由于它们倾向于简化推理过程,以及在下游任务微调期间自评估能力的退化。为了解决这个问题,我们直观地提出了自评估增强训练(SEAT),它使用更强大的EMLLM来评估CoT推理数据。然后使用评估数据来训练EMLLM。然而,由于EMLLM在处理长token输入输出序列方面面临困难,以及作为CoT推理基础的自评估能力的退化,SEAT方法并未完全适应。因此,我们进一步提出了级联自评估增强训练,它将长提示转换为级联的短提示,每个提示专注于特定任务。此外,我们混合CoT推理和自评估数据,以在增强EMLLM自评估能力的同时保留其CoT推理能力。我们还进行了双层数据过滤(DDF),包括源数据过滤和标记数据过滤,使用人工选择和MLLM进行过滤。Cas-SEAT和DDF共同提高EMLLM的性能。实验表明,Cas-SEAT在多个数据集上实现了22.16%的平均提升,而DDF显著减少了训练的资源消耗。

关键词

引用

@article{arxiv.2501.05662,
  title  = {Cascaded Self-Evaluation Augmented Training for Lightweight Multimodal LLMs},
  author = {Zheqi Lv and Wenkai Wang and Jiawei Wang and Shengyu Zhang and Fei Wu},
  journal= {arXiv preprint arXiv:2501.05662},
  year   = {2025}
}