中文

平衡难度的定制化教学:通过提示课程提升多模态思维链推理

计算与语言 2025-10-14 v2 人工智能 多媒体

摘要

多模态思维链提示的有效性常因随机或手动选取的示例而受限。这些示例未能兼顾模型特定的知识分布与任务固有的复杂度,导致模型表现次优且不稳定。为解决此问题,受“平衡难度的定制化教学”这一教学原则启发,我们提出了一种新框架。我们将提示选择重构为提示课程设计问题:构建一组与模型当前能力相匹配的、排序良好的训练示例。我们的方法整合了两种互补信号:(1)模型感知难度,通过主动学习设置中的预测分歧量化,捕捉模型自身认为具有挑战性的内容;(2)内在样本复杂度,独立于任何模型测量每个问题-图像对的固有难度。通过联合分析这些信号,我们开发了一种难度平衡的采样策略,确保所选提示示例在两个维度上均具有多样性。在五个具有挑战性的基准测试与多个流行的多模态大型语言模型(MLLM)上进行的广泛实验表明,我们的方法产生了显著且一致的改进,并极大减少了由随机采样引起的性能差异,为增强多模态推理提供了一种有原则且稳健的方法。

关键词

引用

@article{arxiv.2508.18673,
  title  = {Tailored Teaching with Balanced Difficulty: Elevating Reasoning in Multimodal Chain-of-Thought via Prompt Curriculum},
  author = {Xinglong Yang and Quan Feng and Zhongying Pan and Xiang Chen and Yu Tian and Wentong Li and Shuofei Qiao and Yuxia Geng and Xingyu Zhao and Sheng-Jun Huang},
  journal= {arXiv preprint arXiv:2508.18673},
  year   = {2025}
}