平衡难度的定制化教学:通过提示课程提升多模态思维链推理
计算与语言
2025-10-14 v2 人工智能
多媒体
摘要
多模态思维链提示的有效性常因随机或手动选取的示例而受限。这些示例未能兼顾模型特定的知识分布与任务固有的复杂度,导致模型表现次优且不稳定。为解决此问题,受“平衡难度的定制化教学”这一教学原则启发,我们提出了一种新框架。我们将提示选择重构为提示课程设计问题:构建一组与模型当前能力相匹配的、排序良好的训练示例。我们的方法整合了两种互补信号:(1)模型感知难度,通过主动学习设置中的预测分歧量化,捕捉模型自身认为具有挑战性的内容;(2)内在样本复杂度,独立于任何模型测量每个问题-图像对的固有难度。通过联合分析这些信号,我们开发了一种难度平衡的采样策略,确保所选提示示例在两个维度上均具有多样性。在五个具有挑战性的基准测试与多个流行的多模态大型语言模型(MLLM)上进行的广泛实验表明,我们的方法产生了显著且一致的改进,并极大减少了由随机采样引起的性能差异,为增强多模态推理提供了一种有原则且稳健的方法。
引用
@article{arxiv.2508.18673,
title = {Tailored Teaching with Balanced Difficulty: Elevating Reasoning in Multimodal Chain-of-Thought via Prompt Curriculum},
author = {Xinglong Yang and Quan Feng and Zhongying Pan and Xiang Chen and Yu Tian and Wentong Li and Shuofei Qiao and Yuxia Geng and Xingyu Zhao and Sheng-Jun Huang},
journal= {arXiv preprint arXiv:2508.18673},
year = {2025}
}